Geek Savvy

最强思维模型登基,Geimini 2.5 Pro 王者归来,附5大案例实测

Image

昨天深夜,谷歌发布了其最新最强思维推理模型,Gemini 2.5 Pro,其能力在各大测评基准上,从目前来说已经算是遥遥领先,好巧不巧,2.5 Pro 又被 OpenAI 狙击了,大家的注意力全被 OpenAI 新更新的 GPT-4o 多模态生图功能给抢过去了。

Image

今天,看到许多朋友对 GPT-4o 的实测案例,效果确实不错,图片的可控性和细节比谷歌前几天上线的 Gemini 2 Flash Experimental 的效果还要好。

Image

GPT-4o 中的图像生成从今天开始作为 ChatGPT 中的默认图像生成器向 Plus、Pro、Team 和 Free 用户推出,Enterprise 和 Edu 即将访问,生产力有了明显的提升,感兴趣的朋友们可以玩起来。API 即将未来几周内推出,开发人者很快也能够通过 API 使用 GPT-4o 生成图像。

使用方式:

1. 登录 ChatGPT,选择图片模式即可;

2. 登录 Sora 网站,Plus 用户可无限生成。

官方说明地址:

https://openai.com/index/introducing-4o-image-generation/

好了,话说回来。

这个刚刚推出 Gemini 2.5 的首个版本为 Gemini 2.5 Pro Experimental,在众多基准测试中遥遥领先,达到了 SOTA 水平,比如在 LMArena 排名第一,比刚刚破1400分的 Grok-3 还高出39分。

小科普:LMArena 是一个用于评估和比较大语言模型(LLMs)性能的开源基准测试平台。

Image

Gemini 2.5 它是一个思维模型,推理和代码能力强,在数学、科学、代码生成等多领域表现出色,例如在 Mathematics AIME 2025 单次尝试答题正确率达86.7%。

小科普:Mathematics AIME 2025 是美国数学邀请赛(AIME)的2025年赛事,面向在AMC 10/12中表现优异的学生,是选拔美国数学奥林匹克(USAMO)选手的重要竞赛。

Image

还有很多的测试中,2.5 Pro 都几乎是处于一个领先的状态,这里就不多说了。

Gemini 2.5 Pro 模型同时也具备原生多模态和长上下文窗口,当前为 100 万 token,即将提升到 200 万。现已在 Google AI Studio 和 Gemini app 面向高级用户开放,Vertex AI 也即将上线 。

现在,Gemini 2.5 Pro Experimental 是免费试用(应该是1天50次,完全够用了),大家可以在 Google AI Studio 赶快用起来。

使用地址:

https://aistudio.google.com/prompts/new_chat

进入网址之后,选择 Gemini 2.5 Pro Experimental 模型即可。

Image

先说测试体验感受:

1. 2.5 Pro 模型在做处理之前,都会先思考,不急于回答,有点像 DeepSeek R1,文字的整体的回答更加准确,变现也不错,输出速度快;

2. 2.5 Pro 编码能力整体的细节处理比较细致,几乎都是一遍过,生成速度快,但画面的丰富度没有 Claude 3.7 和 DeepSeek-V3-0324 好,部分能力可以媲美 Claude;

3. 超长的上下文窗口,足足有 100 万,适合长文本推理、写作;

4. 多模态识别能力强,对图片的理解能力有所提升。

实测1:马里奥跑酷小游戏

Prompt:制作一个超级马里奥的无尽跑酷游戏,有可跨越的障碍物,最多3连跳,要求像素化风格,有趣的背景,意外掉落加速包/减速包,且不需要额外 HTML

Image

代码生成速度非常快,一次性完成,UI 设计也还不错,整体的游戏体验也相当可以,感兴趣的可点击下面链接玩一玩。

马里奥跑酷小游戏体验地址:

https://vh66zb13ru.app.yourware.so/

实测2:粒子模拟页面

Prompt:生成一个精美的 HTML 页面,在页面中实现具备反射效果和彩色粒子模拟的视觉特效。反射效果要模拟出真实世界中物体在平面上的反射,反射的内容应随着页面的滚动或者鼠标的交互而产生动态变化。彩色粒子模拟部分,粒子需要呈现出多种鲜艳的色彩,粒子的运动轨迹要随机且流畅,并且可以根据用户的鼠标操作(如点击、移动)做出相应的反应,例如鼠标点击处生成新的粒子,鼠标移动时粒子跟随鼠标轨迹有一定的偏移。同时,要保证页面的整体性能良好,在不同分辨率的设备上都能正常显示和运行。

Image

这个粒子模拟的页面效果就比较一般,整体效果还行,粒子呈现出多种颜色,粒子会随着鼠标移动、聚集、释放,但粒子反射效果我看不出来,还有粒子没有随着我的鼠标点击而生成新的粒子。

实测3:上传一本书《马斯克传》

上传了一本 37.8 万字的《马斯克传》(有部分书评是说50万字),对这本书的章节片段进行提问,连续追问测试 Gemini 2.5 Pro 的长上下文联系和能力。

Image

对《马斯克传》的第 40 个章节片段进行 500 字总结,2.5 Pro 能很好的知道这部分主要讲述了马斯克对AI(人工智能)的看法、担忧以及他的实际行动,同时对佩奇可能是“物种主义者”也做出了描述,还有谷歌收购 DeepMind 后,马斯克的担忧加剧,促使他联合 Sam 等人创立了非营利研究机构 OpenAI 也是表达正确,整体还是描述得比较全面。

同时,问一个细节性的问题,“2015年,马斯克跟比尔盖茨出席了什么论坛”,2.5 Pro 也是回答准确。

Image

拿出《马斯克传》校验

实测4:考研数学题

直接截图上传考研数学题,这个案例能很好得测试模型对图片的理解能力和推理能力,速度贼快,10秒左右就做出来了,反正就是一顿推理,最后结果是对的,数学天才的你可以帮我看看它整个推理过程有没有毛病,评论区告诉我。

Image

这是该选择题的答案即简单解析。

Image

实测5:难度升级,做考研大题

直接上强度,来一道考研大题,知识浅薄的我硬是看了整个推理过程,还是没搞的太明白,一顿推理感觉没什么大毛病,但是这个结果呢,感觉又对又错的,还是留给评论区的大神们来检查一下。

Image

考研大题及答案。

Image

Last but not least

从以上 5 个实测案例来看,我们从 Gemini 2.5 Pro 提升的代码能力、推理能力、多模态能力、长文本能力进行了相对应的测试,总体来看,这几个方面确实有了不少提升,尤其是代码能力和长文本推理,某些方面确实可以媲美 Claude 3.7 Sonnet 和 DeepSeek-V3-0324。

现在是 100 万的上下文,200 万的已经在路上,现在还是免费,可以冲起来了。