Gemini 3 编程第一断崖式领先,谷歌 AI Mode 直接装备 G3,反重力的 Antigravity 是啥?
注:因为谷歌的图模型 Nona Banana Pro 发布了,先补充一篇墨问里新鲜出炉的笔记,生图效果惊艳:新版本 Nona Banana Pro 彻底了解决生图的文字处理,效果炸裂。
//以下是正文
今年 8 月发布的 GPT 5 并没有达成人们想象中的 AGI,显然,Gemini 3 也不大可能是人工智能的分水岭,但能力提升是显而易见的,跨度好于 GPT 5。
前端工程师高喊:Gemini 3 已经让我们哀嚎一片了,找工作难度再+1。对此我的建议是,哀嚎的同时,尽可能用 AI 保住你现有的工作。至于“捅破天、天塌了、哀鸿遍野”这样的说法,我们已经听过不止一百遍。你不照样在写代码?喊久了,终究会习惯。
还是让我来梳理一下 Gemini 的发展脉络吧,这也是谷歌在 AI 领域打翻身仗的轨迹:Gemini 1 把多模态作为默认形态,从文本扩展到图像、音视频与代码;Gemini 2.5 把“能干”升级为“能想和执行”,在编码与复杂任务上先拆解、规划、再执行;Nano Banana 把图形的一致性推到了一个新的高度。到了 Gemini 3,编程和推理能力达到了一个新高度,同时,Google 直接把“最强模型 3.0”塞进 Search 的 AI Mode,把多年深耕的 AI 能力推到基础设施层,并以更长上下文、更结构化输出与更稳定的工具调用,把模型变成了可编排的系统。
在我看来,相比于 Gemini 3 在方方面面能力的提升,更有价值的事情是,Google 这次把“最强模型”直接塞进 Google Search 的 AI Mode 里,AI 普惠的意义超越了能力的升级。
1
Google 把最强模型,直接塞进了搜索。
我以为这次 Gemini 3 最大的变化,是很多人不太关注甚至看起来有点“无聊”的地方:Search。
Google 官方给 Gemini 3 下的定义,是“目前最智能的模型”,在推理、多模态理解和 Agent 能力上做了全面升级,并且第一次在发布当天就直接接入了 Google 搜索的 AI Mode,等于是把 Search 换了台“新大脑”。
对于用户来说,搜索框的形态没变,但背后的工作方式变了:它能理解更长的问题、更复杂的上下文,给出结构化的答案,以前 AI Mode 的结构化输出简单,现在我们可以得到更完备的搜索结果。Google 自己的说法是,让 Gemini 3 去“承接你最难的问题”,并且通过“generative UI”,把回答拆成块、做成可交互的界面,而不是一条长长的文字。
AI Mode 会增加两种模式:Default 和 Thinking。前者就是以前的方式,后者则基于 Gemini 3 实现专业级推理与生成式布局:
这件事的象征意义不小:当一个公司把最新、最贵的模型,第一时间塞进自己受众最广泛的搜索产品,说明谷歌把这事当基础设施了,并且还是免费的。
2
对开发者而言,Gemini 3 是 2.5 Pro 之后的新一代主力型号。DeepMind 给出的数据是,在一系列编码相关基准上,Gemini 3 Pro 相比 Gemini 2.5 Pro 的解题数量提升了 50% 以上,重点强化的是推理深度、鲁棒性和多模态理解。
Google 在开发者文档里,把 Gemini 3 描述成“建立在最前沿推理能力之上的模型家族”,希望把任何想法带入现实,包括复杂的 Agent 工作流、自主编程和多模态任务。
听上去是不是有点抽象啊,我们可以这么理解:
第一,模型更愿意、也更擅长“想清楚再动手”。在编码、分析、规划这类任务上,它会先拆解步骤、生成计划,再去执行,而不是一句话直接给你一坨结果。
第二,它变得更“耐心”。Gemini 3 Pro Preview 的上下文窗口来到 100 万 token 量级,支持文本、图片、视频、音频和 PDF 作为输入,可以长时间“记着你在说什么”,也可以一次性读完一个项目级别的代码库或一份很长的报告。
能不能打,还得来拉出来溜溜。看下 LMArena 编程模型的榜单变化就知道了,Gemini 直接从之前的第九位冲上了第一,分数断崖式领先:
显然,从 2.5 到 3,不只是“再快一点、再准一点”,而是把编程、推理和链路调度又往前推了一步。今年 10 月份我在 AI Studio 里使用 Gemini 3 的测试版,已经可以很容易模拟一个前端 macOS 的交互出来了,稳定版能力可想而知。
3
Gemini 3 的 Agent 能力也加强了。
如果说 Gemini 2.5 主打 Chat、推理、深度研究和图片处理,Gemini 3 则开始系统化地往 Agent 方向走了。
Gemini 3 是围绕 agentic workflow 设计的:可以可靠地调用工具,执行多步任务,维护长链路状态,并且通过结构化输出,让上层应用把结果接住。
为此谷歌还推出了一个新工具,叫做:Antigravity,这是个围绕 Gemini 3 Pro 打造的“Agent-first” 开发环境。它一半像 IDE,一半像任务指挥中心,多个 AI Agent 可以同时读代码、开终端、开浏览器,自动生成任务列表、计划和执行记录,这些记录会被整理成所谓的“Artifacts”,方便人类随时看懂 AI 干了什么、为什么这么干。现在已经可以下载使用了。
这和早期那种在编辑器侧边开个聊天窗,让模型帮你补全代码、读仓库和模版的体验,是完全不同的方式。Artifacts 更像是在 IDE 里塞进了一个“虚拟项目组”:有人负责读需求,有人负责写实现,有人一直在记录过程,最后再交付一个整体结果。
Gemini 3 的 Agent 能力,也被一路延伸进搜索和 Workspace。Google Workspace 的更新里也明确提到,Gemini 3 将进入面向企业客户的 Gemini 应用,帮助处理更复杂的问题和工作流。
换句话说,Gemini 跳出了自己的 App,不再满足回答和处理对话框里的问题,而是开始接管一部分“执行层”的事情。
——————
对普通用户来说,Gemini 3 上线,只是一次产品设计,但会感觉到对话框里的能力增强,编程更厉害,推理很严密。AI Mode 用户会感觉 搜索框能思考了,搜索的结果也变了。旅行规划、复杂对比、学习一门新技能,它能帮你少开很多标签页,用一种更接近“对话”的方式,把信息组织和处理好。
对开发者来说,Gemini 3 现在更像一个“带着工具箱来上班的搭档”。在 Vertex AI 和 Gemini API 里,你能得到一个更好的编程伙伴:
可以读一整仓库代码、理解产品文档、同时解析截图和日志的多模态模型;
可以主动规划任务、调用函数、写代码、跑测试,再把中间过程留痕的 Agent 引擎。
最让我感兴趣的是 Antigravity 这个 Agent IDE 来了,我很想看看,用这个新工具,自己能做点什么。//我正在整理上手指南,稍后分享给大家:
如果把近三年大模型的进展压缩成一条线,从 GPT-3 到 GPT-4,再到今天的 Gemini 3,我看到了这两个趋势:
第一,模型的“感知范围”在不断扩张:从只看文字,到看图、看视频、听音频,再到读整站网页、整仓库代码,甚至直接嵌进操作系统和应用。Gemini 3 的百万级上下文,只是这个过程的一个阶段性节点。
第二,模型和“界面”的边界在变模糊。Google 提出的 “generative UI”,本质上是让模型直接参与界面编排;Antigravity 则让 Agent 在 IDE 里“自由走动”。下一步,很可能就是浏览器、桌面、手机系统都变成一层统一的“AI 皮肤”?
Maybe,人类的工作方式也在做明显的变化,从亲自点每一个按钮,变成告诉 AI“我要到哪儿去”,然后监督它怎么走。
这时候人的价值在哪里呢?在于更好的认知、判断力和决策力:什么样的任务适合模型,什么时候把任务交给模型,什么任务交给什么模型,什么时候亲自上手,什么时候让 AI 介入;什么时候信任它,什么时候又要作大量的验证工作……