谷歌Gemini展示的视频被疑剪辑过,测试标准偏颇
在仔细阅读发布的60页技术报告后,一些不妥之处浮出水面。在MMLU测试中,Gemini的结果下方用灰色小字标称CoT@32,意味着使用了思维链提示技巧并尝试了32次选择最佳结果。相比之下,GPT-4则无提示词技巧,仅给5个示例。在这种标准下,Gemini Ultra实际上并不如GPT-4。
此外,原图的比例尺也存在问题。90.0%与人类基准89.8%明明只差一点,但在y轴上却拉开很远。HuggingFace技术主管Philipp Schmid用技术报告中披露的数据修复了这张图,使其展示更为公平。
然而,在使用思维链提示技巧并尝试32次的标准下,Gemini Ultra确实表现出超越GPT-4的能力。
关于那段引人注目的视频,有人从开头的文字免责声明中发现了问题。机器学习讲师Santiago Valdarrama指出,声明可能意味着展示的内容是经过精选的优秀成果,而非实时录制,而是经过剪辑处理。
随后,谷歌在一篇博客文章中阐述了多模态交互过程,实际上也默认了通过拼接静态图片和多段提示词的方式,才实现了这样的效果。
尽管如此,谷歌Gemini的发布仍然为其他团队带来了巨大信心,使得GPT-4不再成为唯一难以超越的存在。
正如AI搜索产品PerplexityAI的创始人Aravind Srinivas所总结:
1、Gemini 证明了 OpenAI 之外的团队可以搞出超越 GPT-4 的模型;
2、训练到位的密集模型可以超越 GPT-4 的稀疏模型架构;
推论:从大教师模型蒸馏小尺寸密集模型会成为未来趋势,实现效率和能力的最佳结合。
更多网友关注的问题是,现在是否还有必要继续为每月20美元的ChatGPT Plus付费?
目前,Gemini Pro版本已经整合到谷歌聊天机器人Bard中,实际表现是否如宣传所说,还需观察。
Gemini真的超越了ChatGPT吗?
首先,需要明确的是,目前大家能够体验到的是Gemini Pro版本,也就是对标GPT-3.5的中杯版本。
针对GPT-4的大杯版本Gemini Ultra,预计明年才会推出。
此外,目前Gemini仅支持英文,中文和其他语言的支持将在后续推出。
尽管暂时无法体验Gemini Ultra,威斯康星大学麦迪逊分校副教授Dimitris Papailiopoulos采取了一种巧妙的方法:
他将Gemini发布时展示的原题交给GPT-4进行对比测试,结果在14道题中,GPT-4大约获得了12分。
在这14道题中,有两题由于截图质量问题无法更清晰地呈现,因此给GPT-4算作0.5分。
除了一道数学题GPT-4解答错误之外,其他题目的表现水平则基本持平。
接下来,要评估一个大模型的综合能力,编写代码能力是不可或缺的一部分。
根据众多测试结果,Gemini在编程方面的表现确实令人满意。
某开发者尝试让Gemini使用Pytorch实现一个简单的CNN网络,结果Gemini仅用2秒便完成了任务,且代码质量更优。
当然,Gemini速度较快的原因可能是因为Bard所使用的Gemini Pro尺寸较小,而GPT-4的速度相对较慢,这已经是众所周知的事实。
然而,在编写SQL语句方面,这位开发者认为Gemini的表现并不尽如人意。
然而,对于众多开发者而言,有一个令人振奋的好消息:在遵循指令方面,Gemini相较于Bard之前的版本取得了突破性的提升。
相关AI交流群,请点击GS公众号首页获取!