Geek Savvy

谷歌发言人承认:Gemini AI展示视频的内容和语音回应并非现场实时生成

Image

引言

Image

近期,谷歌发布了一段关于其大语言模型Gemini的演示视频,引发了业界和公众的广泛关注。然而,谷歌发言人近期承认,这段视频并非实时录制,这让人们对于Gemini AI的实际性能产生了更多的好奇。今天,我们就来一起探讨这段视频背后的故事,以及Gemini AI的性能和应用前景。

Image

AI

一、Gemini AI演示视频的非实时录制

在这段一镜到底的视频中,Gemini模型展示了其强大的理解能力,如发现藏在指定塑料杯内的纸团,或者看出一张“连点成线”的图片画的是螃蟹。然而,谷歌发言人向彭博社、Tom's Hartware 等外媒透露,这段演示视频实际上是利用镜头中的静止图像帧和文字提示“拼凑”而成的。此外,视频中用户与Gemini的语音互动也由后期配音完成。

Image

AI

二、视频目的:激发开发人员灵感

尽管视频并非实时录制,但谷歌DeepMind研究副总裁Oriol Vinyals表示,这段视频的目的是为了展示使用Gemini构建的多模态用户体验“可能的样子”,以激发开发人员的灵感。他强调,视频中的所有用户提示和输出都是真实的,仅为了简洁起见进行了缩短。

AI

三、Gemini AI的性能亮点

Gemini AI的性能在许多方面都表现出了超越当前时代的“先进结果”。在32个广泛使用的学术基准测试中,Gemini Ultra在30个测试中都取得了优异的成绩。其中,它以90.0%的得分成为第一个在MMLU(大规模多任务语言理解)上超越人类专家的模型。这一测试涵盖了数学、物理、历史、法律、医学和伦理等57个学科。

此外,Gemini Ultra在新的MMMU基准测试上也表现出了59.4%的领先级性能。该测试涵盖了“需要深思熟虑的”不同领域的多模态任务。

Image

AI

四、Gemini AI的应用前景

谷歌计划在明年初推出全新升级的Bard Advanced,让用户可以更好地体验到其最好的模型和功能,也就是Gemini Ultra。这将有助于进一步拓展AI在各个领域的应用,为用户带来更多便利和创新体验。

AI

结语

虽然Gemini AI的演示视频并非实时录制,但这并不影响其在学术基准测试中的出色表现。谷歌通过这段视频展示了Gemini AI的巨大潜力,有望激发开发人员的热情,推动AI技术的进一步发展。让我们拭目以待,看Gemini AI将如何改变我们的生活和工作方式。

官方介绍:

https://blog.google/technology/ai/google-gemini-ai/#sundar-note

技术文档:

https://storage.googleapis.com/deepmind-media/gemini/gemini_1_report.pdf

官网页面:

https://deepmind.google/technologies/gemini/#capabilities

相关AI交流群,请点击GS公众号首页获取!

Image

素材来源官方媒体/网络新闻