谷歌发言人承认:Gemini AI展示视频的内容和语音回应并非现场实时生成
引言
近期,谷歌发布了一段关于其大语言模型Gemini的演示视频,引发了业界和公众的广泛关注。然而,谷歌发言人近期承认,这段视频并非实时录制,这让人们对于Gemini AI的实际性能产生了更多的好奇。今天,我们就来一起探讨这段视频背后的故事,以及Gemini AI的性能和应用前景。
AI
一、Gemini AI演示视频的非实时录制
在这段一镜到底的视频中,Gemini模型展示了其强大的理解能力,如发现藏在指定塑料杯内的纸团,或者看出一张“连点成线”的图片画的是螃蟹。然而,谷歌发言人向彭博社、Tom's Hartware 等外媒透露,这段演示视频实际上是利用镜头中的静止图像帧和文字提示“拼凑”而成的。此外,视频中用户与Gemini的语音互动也由后期配音完成。
AI
二、视频目的:激发开发人员灵感
尽管视频并非实时录制,但谷歌DeepMind研究副总裁Oriol Vinyals表示,这段视频的目的是为了展示使用Gemini构建的多模态用户体验“可能的样子”,以激发开发人员的灵感。他强调,视频中的所有用户提示和输出都是真实的,仅为了简洁起见进行了缩短。
AI
三、Gemini AI的性能亮点
Gemini AI的性能在许多方面都表现出了超越当前时代的“先进结果”。在32个广泛使用的学术基准测试中,Gemini Ultra在30个测试中都取得了优异的成绩。其中,它以90.0%的得分成为第一个在MMLU(大规模多任务语言理解)上超越人类专家的模型。这一测试涵盖了数学、物理、历史、法律、医学和伦理等57个学科。
此外,Gemini Ultra在新的MMMU基准测试上也表现出了59.4%的领先级性能。该测试涵盖了“需要深思熟虑的”不同领域的多模态任务。
AI
四、Gemini AI的应用前景
谷歌计划在明年初推出全新升级的Bard Advanced,让用户可以更好地体验到其最好的模型和功能,也就是Gemini Ultra。这将有助于进一步拓展AI在各个领域的应用,为用户带来更多便利和创新体验。
AI
结语
虽然Gemini AI的演示视频并非实时录制,但这并不影响其在学术基准测试中的出色表现。谷歌通过这段视频展示了Gemini AI的巨大潜力,有望激发开发人员的热情,推动AI技术的进一步发展。让我们拭目以待,看Gemini AI将如何改变我们的生活和工作方式。
官方介绍:
https://blog.google/technology/ai/google-gemini-ai/#sundar-note
技术文档:
https://storage.googleapis.com/deepmind-media/gemini/gemini_1_report.pdf
官网页面:
https://deepmind.google/technologies/gemini/#capabilities
相关AI交流群,请点击GS公众号首页获取!
素材来源官方媒体/网络新闻