视觉错觉也能识别?被忽略的 Gemini 1.5 Flash 有哪些神奇表现?|AI 鲜测
高速响应:优化后的架构使其在处理大量数据时能迅速响应。
长上下文窗口:支持长达两百万标记的上下文处理,使其能够应对复杂的任务,如长视频分析和多章节文档生成。
多模态处理:不仅能处理文本,还能对图像、音频和视频进行深入分析和理解。
场景1:科普撒切尔效应
场景2:教我玩游戏!
🐰 按照它教的我玩了两次,但还是失败了(感觉它开始出错了)。我姑且再信它一次,接着再问它说怎么玩。
🐰 到这里,会发现 Gemini 1.5 Flash 能够通过视频教会我玩这个游戏,它能够处理视频输入,生成详细且准确的指示和解释。
场景3:看图讲故事
🐰 让它看图讲故事。它直接根据图片内容在5秒钟之内就生成了一个完整的故事(故事还带有哲理性和反转性),这理解能力也是极强了,而且还是中文故事。
🐰 让它继续写一个,生成的故事风格都不带重样的,现代都市风、未来科技风啥啥都有,关键是效果还不错。
它能在10s左右生1万字故事的内容大纲,并分好章节,有每一章的简单介绍,很有条理。
它能在3~5分钟内生成1万字故事每一章的详细内容(手动输入不友好),同时能够有效保持前后文的一致性,确保故事情节流畅,细节丰富。
🐰 这些特性对于需要处理大量背景信息的任务,如技术文档编写、深入对话、故事创作灵感激发都非常有用。
🐰 这么来看,Gemini 1.5 Flash 还是有点东西的!根据图像生成相关的故事情节,比如一口气连续生成故事情节连贯的故事,而且生成文本内容质量相对较高,对于中文的理解也很不错。看来是有真本事的!
视频源于网络
🐰 Gemini 1.5 Flash 不仅可以识别出视频的主要是讲啥的,而且分析出视频中上下左右每个图片的具体内容,比如通过旋转参数的调整,可以看到图像中卡通老人的姿态发生变化,分析效果直观明了。
🐰 但同样的问题问 ChatGPT,视频针对于视频的分析并不能直接分析,反而回答提取一帧一帧的画面进行分析,我们还是期待一下 GPT-4o 的更新吧。
场景5:这本书值不值得买?
🐰 它回答的速度倒是挺快,识别出了书籍作者,但说原作者是 sam altman,这就开始妥妥的幻觉了,同时也缺少具体价格信息。
🐰 在第二问中 Gemini 1.5 Flash 开始一本正经胡说八道了。
这本书到底讲了啥内容,目录在这儿了。
最后
🐰 在这个“什么都快”的时代,Flash 真是名不虚传,生成的内容又快又好。
在图片测试中,Gemini 1.5 Flash 不能直接生成图片,这一点得向 ChatGPT-4o 学习学习。
在视频测试中,Gemini 1.5 Flash 虽然能识别视频中的主要内容和画面细节,但在处理音频输入时还有些不足,这在多模态输出方面也体现出来。