元宇宙与人工智能三十人论坛

谷歌全新Gemini Omni首曝

谷歌I/O 2026大会开幕在即,一款名为 Gemini Omni 的原生视频模型意外提前曝光。那个“教授在黑板上流畅推导数学公式”的演示视频,不仅直接刷屏全网,更靠硬实力宣告:AI视频生成,已经正式告别“一眼假”的草稿时代。
如果有人问目前视频生成领域最大的技术难点是什么?答案一定是“文本准确性”。以前,像Sora这类大模型生成的文字,基本属于远看像字、近看全是“鬼画符”的状态。一旦涉及到极其严谨的理科推理,AI基本都会直接翻车。
但这次 Gemini Omni 彻底打破了这一刻板印象。在刷屏的“教授黑板推公式”demo中,AI生成了一位教授,手持粉笔在黑板上一步一步写出三角恒等式的数学证明。更令人震惊的是,画面不仅保留了粉笔书写的自然笔触,教授还在用口语同步讲解当前的推导步骤。更逆天的是,这段视频的生成指令仅用了简单的三句话,不仅公式全对,推导逻辑连冠,书写也极其自然,几乎看不出任何数字生成的破绽。
那么,“视频版香蕉”这个称号是怎么来的呢?此前,谷歌旗下有一款名为 Nano Banana 的爆款AI图像生成工具,因为极强的提示理解和高质出图风靡全球。此次,Gemini Omni 就像 Nano Banana 一样,被深度集成到了 Gemini 生态之中,支持文本、图像、音频、视频全能输入和输出,因此被网友戏称为高维度的“视频版香蕉”。
除了强大的生成能力,它还在“实时编辑”上祭出了杀手锏:
一键去水印: 只需要给一句话,它就能直接移去画面上的水印,且毫无破绽。
天衣无缝的替换: 演示中,上传一段关于意大利面的视频,动动嘴让它把“意大利面”换成“奶油浓汤”,它瞬间就能精准替换物体,不仅光影细节对得上,连盘碗的遮挡逻辑都安排得明明白白。
风格化输出: 它甚至支持一键输出电影动漫风格,其火焰特效和打斗感流畅得堪比专业手绘。
Gemini Omni 这次曝光的时间点,火药味十足。就在两周前,曾经轰动全球的 OpenAI Sora 由于推理成本极高(每天高达100万至1500万美元)以及用户留存极低(新版30天内发布后只剩8%用户),被正式关停退场。
在其他玩家大撤退之际,谷歌却带着视频版的“香蕉”强势进攻AI AGI创作赛道。Omni 目前生成规格为 10秒时长、1280x720分辨率。尽管目前早期测试显示其生成额度消耗非常快、烧钱速度同样惊人,但它解决文本不连贯和推理难题的能力,确实给死气沉沉的AI视频赛道打了一针强心剂。
谷歌用这样一盘粉笔推导出的“全对公式”告诉我们,AI 视频真的不再仅仅是玩具了。