浮之静

全面解读:Gemini 3 & Antigravity IDE

Image

Gemini 3

Google 新一代通用模型

2025 年 11 月 18 日,Google 发布了 Gemini 3(A new era of intelligence with Gemini 3[1]),并首次在发布当天就将其接入搜索、Gemini App、云端开发平台等核心业务。

撇开官方的“目前最智能的一代模型”表述,可以更朴素地理解为:Gemini 3 是 Google 用来处理文本、图像、视频、音频和代码等多种信息的最新通用底层引擎。

它不是一个单独的 App,而是一整个产品族:

  • 用户侧:嵌入搜索和 Gemini 应用
  • 开发者侧:提供 Gemini 3 Pro 预览版与增强推理的 Deep Think 模式
  • 企业与平台侧:通过 Vertex AI、Gemini API 以及新平台 Antigravity 等形态提供

从 Gemini 1 到 Gemini 3

Google 将 Gemini 的演进大致分为三代:

  • Gemini 1:解决“能看什么、能看多长”的问题
    • 原生多模态(文字、图片等混合输入)
    • 更长的上下文窗口,一次处理更多信息
  • Gemini 2 / 2.5:探索“代理式能力(agentic capabilities)”
    • 更强调推理与复杂任务处理:拆解任务、调用工具、写代码、执行多步操作
    • Gemini 2.5 Pro 长期在 LMArena 榜单靠前
  • Gemini 3:在前两代基础上的大版本迭代
    • 提升推理深度与细节理解
    • 加强跨模态综合(文本 + 图像 + 视频等)
    • 改进长期规划和工具使用的稳定性
    • 更系统地嵌入搜索、开发工具和企业产品

可以理解为:Gemini 3 主要升级的是“理解能力”和“使用场景”,而不是单纯扩大模型规模。

推理能力:更强了么?

Google 和外部机构使用多种公开基准测试 Gemini 3 的推理能力,重点评估“解题能力”而非“记忆力”,典型代表包括 Humanity’s Last Exam[2]、GPQA Diamond[3]、ARC-AGI-2[4] 等。

Image

Gemini 3 Pro 与 Deep Think 的核心表现可概括为:

  • Humanity’s Last Exam(HLE):综合性难题集,涉及科学、数学和常识推理
    • Gemini 3 Pro(无工具):约 37.5%
    • Deep Think(无工具):约 41%
  • GPQA Diamond:难度接近博士考试的自然科学题集合
    • Gemini 3 Pro:约 91.9%
    • Deep Think:约 93.8%
  • ARC-AGI-2:类“智能测验”,强调模式抽象与迁移能力
    • Deep Think(启用代码执行):约 45.1%
Image

相比只处理文字,多模态是另一个关键方向。Gemini 3 Pro 在多模态基准上的表现包括:

  • MMMU-Pro(多学科多模态题集):约 81%(2.5 Pro 约 68%)
  • Video-MMMU(视频理解):约 87.6%
  • SimpleQA Verified(偏事实性检查):约 72.1%
  • ScreenSpot-Pro(UI 截图 → 正确操作):从上一代的 11.4% 提升到约 72.7%

这些测试综合考察模型对图片、图表、文档、视频片段和屏幕界面的理解能力。它们的重要性在于:  如果模型要“帮用户操作电脑、阅读文档和网页”,就必须先能可靠理解这些视觉内容。 在此之上,Google 才去构建 “Computer Use”(通过模型控制浏览器 / 电脑)的上层能力。

此外,Gemini 3 Pro 在 LMArena[5] 的 Elo 评分约 1501,高于 Gemini 2.5 Pro 及多款同代主流模型。这些数据并不意味着“通用智能已实现”,但说明在一批经过筛选的高难题目上,Gemini 3 系列的推理能力相较上一代有明显提升,并在同代模型中处于前列。

Image
📌 Humanity’s Last Exam

Humanity’s Last Exam(HLE,「人类最后考试」)是 Scale AI 联合 AI Safety Center 推出的新一代前沿基准,总共 2500 道题,覆盖数学、物理、生物/医学、人文社科、计算机/AI、工程、化学等多个学科,其中约 14% 是图文多模态题,约 24% 是选择题,其余为需要精确匹配的简答题,并额外维护一套私有题集防止刷榜过拟合。

Image

题目由约 1000 名来自 50+ 国家、500+ 机构的专家(教授、研究员与研究生)投稿,再经过多轮机器预筛 + 专家评审:只有能「难倒多种前沿 LLM」、且在学科深度与表述质量上过关的题目才会被收入最终集。

HLE 不只看准确率,还强制模型输出置信度,计算「均方根校准误差」(RMS Calibration Error):理想状态是模型真实正确率 30%,平均自信也接近 30%,但当前大部分模型在 HLE 上正确率只有个位数到二十多%,却常常报出 70–90% 的高自信,系统性暴露出“既不会又很自信”的幻觉问题。排行榜使用 95% 置信区间来算名次,避免单点分数造成虚假排序。

从已公开成绩看,即使是 GPT-5 Pro、Gemini 2.5 Pro、Claude 4 系列等最新旗舰模型,在 HLE 上的准确率也大致只在 20%–30% 左右,远远谈不上“考得很好”;而一些开源大模型(如 Llama 4、Mistral、Nova 等)往往只有 3%–8% 左右。这张榜单传递的信号很直接:在这套由全球专家精挑细选、专门为「难倒当代 LLM」设计的试卷上,哪怕是最强模型,距离可靠的“前沿科学闭卷考生”仍有巨大差距。

Image
📌 GPQA Diamond
Image

GPQA Diamond 是 Epoch AI 使用的一套超高难度科学推理基准,来自更大的 GPQA(Graduate-level Google-Proof Q&A)数据集。它包含 198 道四选一选择题,全部由相关专业的 PhD 或在读 PhD 命题和校对,覆盖生物、化学、物理,难度从「高年级本科」到「研究生」不等,设计成就算允许你无限上网查资料,没有专业背景也很难答对,因此被称为 “Google-proof”。

Diamond 子集的筛选非常严格:只保留那种「专家能稳定做对、非专家大多做错」的题——至少一名领域专家答对,且三分之一以下的非专家(即便可以用 Google)能选对答案。最终形成的 198 题上,人类 PhD 专家平均正确率约 69.7%,而熟练的非专家只有约 33%,随机乱猜的基线则是 25%。这些题都需要多步推理与扎实专业知识,而不是简单记忆或关键词搜索。

在评测协议上,Epoch 统一要求模型先显式“思考过程”,最后必须用固定格式输出 Answer: X(X 为 A/B/C/D),否则该题直接算 0 分,因此有些模型如果频繁格式错误,得分甚至会低于 25% 随机基线。在这种严格设置下,OpenAI 用该基准对比过自家 o1 与人类专家;Epoch 也持续用同一协议评测各大前沿模型,并给出置信区间,比如部分最新模型在 GPQA Diamond 上已经能逼近或超过 80%–90% 准确率,用来刻画「在高阶理科推理上,模型离 PhD 专家还有多远」。

📌 ARC-AGI-2
Image

它是 ARC Prize 基金会发布的新一代通用智能基准。ARC-AGI 的定位不是考“博士级知识”,而是刻意收集一批「人类普通人两次以内能做对,但现有 AI 非常吃力」的任务,用这条“人类易、AI 难”的分界线来度量 AGI 缺口:只有当这类任务对 AI 也变得顺手自然,他们才认为可以宣称接近 AGI。

与上一代相比,ARC-AGI-2 在难度和严谨性上大幅升级。所有评测题都经过数百名人类校准,确保每题至少有两个人在两次尝试内解出,同时扩大题量、去掉可以靠暴力穷举解决的题目,并新增专门针对 AI 弱点设计的题型,重点考察三类能力:符号解释(把图案当成有语义的符号来理解)、组合推理(多条规则叠加交互)、以及上下文依赖规则(同一操作在不同情境下要做出不同选择)。数据集被拆成四部分:公开训练集、公开评测集、Kaggle 排行榜用的半私有集,以及最终评奖用的完全私有集,统一采用 pass@2 规则。

Image

在这个新基准上,现实情况相当“打脸”:人类在 ARC-AGI-2 上接近 100% 正确率,而当前最强推理系统(如类似 o3-preview 这种“推理 + 搜索”架构)得分只在 个位数百分比,而且往往要花上 每题几十到几百美元的算力成本;纯 LLM(如 gpt-4.5)几乎直接掉到 0%。因此 ARC 团队明确提出:从现在起,他们不会只看“得分一维”,而是同时公布「得分 + 每题成本」这两个指标,把“高效解决问题”的能力也纳入智能定义的一部分,防止用无限暴力搜索来伪装“聪明”。

Image

ARC-AGI-2 传递的核心信息是:算力已经够大了,真正缺的是新的架构和想法,他们希望用一个“人类易、AI 难”的硬核基准,把整个社区拉向更像真正“通用智能”的方向,而不是继续在应试和刷分上打转。

Deep Think 模式:为难题“开大号”

Deep Think 是 Gemini 3 中增强推理的模式。它并非完全不同的模型,更像是“同一代模型的加长计算版本”:在复杂任务上投入更多算力和思考步骤,尝试更长的推理链。相较 Pro 模式,Deep Think 的提升主要体现在:

  • 在 Humanity’s Last Exam、GPQA Diamond 等难题集上进一步提高数个百分点;
  • 在 ARC-AGI-2 这类强调抽象推理的基准上,把成绩拉升到约 45.1%;
  • 多模态任务(如 MMMU-Pro、Video-MMMU)上也有一定增益。

目前 Deep Think 优先提供给安全测试人员,待进一步评估后,再逐步向 Google AI Ultra 订阅用户开放。这种“小范围验证 → 再扩展”的方式延续了前几代的做法。

三大能力方向:“学、建、计划”

官方用“三个动词”来概括 Gemini 3 的使用方向:帮助学习、帮助构建、帮助规划。

1. 帮你“学”:信息整理器与转译器

依托百万级上下文、多模态输入和多语言能力,Gemini 3 可以将碎片化、格式各异的材料汇总到同一场景中处理,例如:

  • 识别、整理多语言、手写的家族菜谱,生成结构化的电子菜谱;
  • 将一门课程涉及的论文、长视频讲解、PPT、论坛讨论综合整理,拆成清晰的知识结构,并生成闪卡、可视化代码、小测验等;
  • 分析体育视频(如 pickleball 比赛),指出动作问题并生成训练建议。

本质上,Gemini 3 在这些任务中承担的是:把难啃、分散的内容转译为更容易理解和复用的形式。

在搜索产品中,Gemini 3 被用于 AI Mode,生成更结构化、带可视化和交互组件的结果页,用于解释例如 RNA 聚合酶这类复杂概念。在部分地区与订阅层级开放 “Thinking” 模式,直接使用 Gemini 3 Pro 作为搜索中的核心模型。

2. 帮你“建”:从代码建议到“半自动写项目”

开发者侧,Gemini 3 更像一个可执行任务的编码助手和代理模型:

  • Terminal-Bench 2.0:约 54.2%——通过终端调用工具、执行命令、处理文件等方面表现稳定;
  • SWE-bench Verified:约 76.2%——在真实开源项目场景下自动修 bug 的成功率较高;
  • WebDev Arena 等评测中,Web 开发相关能力也处于前列。

结合官方 demo,Gemini 3 大致可以帮开发者做的事情包括:

  • 生成交互式 Web UI、3D 小游戏、数据可视化等;
  • 阅读现有代码,提出重构建议或生成可用补丁;
  • 在终端与浏览器之间来回调试:运行测试、查看日志、刷新页面效果等。

这并不意味着工程师可以彻底“放手不管”,但在搭原型、处理模板化任务、执行重复性操作方面,Gemini 3 已经能承担大量具体步骤。

3. 帮你“计划”:从计划清单到实际执行

在长时序规划与执行上,Gemini 3 也进行了针对性优化。典型基准是 Vending-Bench 2[6]:模拟经营一整年的自动售货机业务,要求模型持续决策、调用工具、调整策略。

在该测试中,Gemini 3 Pro 的收益与决策连贯性优于同代多款模型,说明它在“持续执行多步任务而不偏题”方面有一定优势。落到产品层面,这类能力被用在:

  • Gemini App 中的 Gemini Agent:帮助用户整理邮箱、预约服务、处理一连串操作;
  • 企业与开发环境中:执行复杂 CI/CD 流水线、脚本任务、数据管道等。

关键变化:模型不再只给 To Do 列表,而是在用户授权下真正执行其中的部分步骤。

📌 Vending-Bench 2

这是 Andon Labs 推出的新一代代理评测基准,用来测试模型在 一年时间尺度内经营一台自动售货机 的真实能力。模型从 500 美元起始资金 出发,在最多一年的模拟中负责选品、找供货商、补货、定价、处理投诉等,最终以 一年结束时的账户余额(多次运行取平均) 作为成绩,核心考察的是在超长时序下能否始终保持稳定、理性和高效的决策能力。

Image

在具体机制上,模型如果连续 超过 10 天付不起每天 2 美元的场地费,就会被判定破产并提前结束。它可以上网搜索供应商,通过邮件工具询价和下单,货物送达仓储点后,再用提供的操作工具在仓库和售货机之间搬运商品。销售收入由顾客购买产生,而销量受 星期几、季节、天气和价格 等多因素影响。完整跑完一年,通常会产生 3000–6000 条消息,单次运行模型输出约 6000 万到 1 亿 tokens,真正把「长时序决策 + 运营成本」压在模型身上。

相较初代 Vending-Bench,Vending-Bench 2 更接近现实世界的“脏乱差”:供应商可能是 对抗性的,虚高报价甚至货不对板;就算诚实供货,也会尽量抬价,逼着代理学会 谈判;物流会延迟,长期合作的供应商随时可能倒闭,迫使代理建立冗余供应链;不满的顾客会随机出现要求高额退款。评分规则被简化为只看 一年后的余额,同时为代理增加了记笔记、提醒等规划工具,以观察模型是否能利用这些辅助能力改善长期运营表现。

最新榜单中,Gemini 3 Pro 以约 5478 美元 的期末余额暂居第一,其后是 Claude Sonnet 4.5、Grok 4、GPT-5.1 和 Gemini 2.5 Pro。作者指出,Gemini 3 Pro 的优势主要体现在两点:一是 全程工具使用模式非常稳定,随时间推移几乎看不到性能“崩坏”;二是 在寻找合理定价的供应商方面异常可靠,往往会在一开始就投入精力锁定好价格,而不是先随便签一份高价合同,再试图用谈判“补救”。

Image

在此基础上,Andon 又推出带竞争要素的 Vending-Bench Arena:环境与 Vending-Bench 2 相同,但多个代理在 同一地点各自经营一台售货机,会出现价格战和策略博弈,也可以互相发邮件、转账、交易货品,形成合作或合谋,不过 计分仍按各自盈利单独计算。这是 Andon 的首个多智能体评测,用来观察模型在经济竞争场景下是否会涌现更复杂的策略行为。作者还估算了一个“人类高手策略”的上限:假设选用测试中表现最佳的品类(如大包 Doritos),现实中他们的 AI 售货机甚至卖出过 500 美元的钨块;再保守假设通过谈判把进货价砍半,每天大约可赚 206 美元、持续 302 天,一年约 6.3 万美元。这与当前最强模型仅几千美元级别的余额之间形成鲜明对比,凸显出:在这种看似“小生意”,实则高度长程耦合的任务上,模型虽已明显进步,但离真正可靠的经济代理仍有巨大提升空间。

安全与评估

Google 将 Gemini 3 定位为“迄今安全评估最充分的一代模型”,重点改进方向包括:

  • 降低“迎合性”(sycophancy):减少为迎合用户而牺牲事实的倾向,尤其是在敏感话题上。
  • 增强对 prompt 注入的防御能力:通过额外训练和策略,提高对恶意指令的识别与拒绝能力,避免被诱导执行不期望的操作。
  • 限制高风险场景的滥用(尤其是网络攻击相关):在训练、推理策略和输出限制上加入约束,减少模型直接被用作攻击工具的可能性。

在评估方法上,除了内部的 Frontier Safety Framework[7],Google 还与英国 AI Safety Institute[8] 等机构合作测评,并引入 Apollo、Vaultis、Dreadnode 等第三方安全公司进行独立审查。相关细节会整理在 Gemini 3 的模型卡(model card[9])中,对外说明评估范围与已知限制。

Google Antigravity

围绕 Gemini 3 搭建的 agent-first 开发平台

与 Gemini 3 同时亮相的,还有 Google Antigravity[10]。  它不是新模型,而是一个围绕 Gemini 3 打造的 “代理优先(agent-first)” IDE,形态上可类比 Cursor[11]、Windsurf[12] 等代码开发工具。

Image
😅 无法登录

我暂时卡在登录上了(授权完成,无法点击下一步),就暂时不写测评了。登录问题已经有很多人反馈了,应该是 google 的问题。虽然说修复了,但我还是无法登录,后面再试吧,就先不写测评了。

Image

它一方面保留了你熟悉的 IDE 形态(智能补全、行内命令、侧边栏助手),另一方面围绕更强的 Gemini 3 等模型,引入浏览器控制、跨界面操作、长时任务编排,让代理可以 自主规划并执行端到端的软件开发工作,而不是只写几段代码片段。目前处于 免费公测,提供较宽松的 Gemini 3 Pro 调用额度。

Antigravity 围绕「协作式开发」提出四个核心理念:信任(Trust)、自主(Autonomy)、反馈(Feedback)、自我提升(Self-improvement)。

核心理念

信任(Trust)

如何让用户真正信任代理在做的事?

现在很多产品不是把代理的每一次调用细节全都摊开,就是只给你最终 diff 出来的代码,中间过程完全黑箱,这两种都很难建立信任。Antigravity 把交互提升到任务级别的抽象:

  • 对话里,工具调用会按「任务」分组展示,你看到的是每个任务的进度和高层摘要。
  • 代理在执行过程中不断产出 Artifacts(工件):例如任务清单、实现方案、演练式 walkthrough、截图、浏览器录屏等,这些东西比原始 tool call 更容易被人类检查和验证。
  • 产品强调:代理不仅要「完成工作」,还要系统性地验证自己的工作,并把验证过程通过 Artifacts 呈现给你看。

自主(Autonomy)

从“在某个界面里嵌个助手”,到“以代理为中心的多界面控制”

  • Antigravity 仍然提供一个你很熟悉的 Editor 视图:一个强化版 AI IDE,支持 Tab 补全、行内命令,以及嵌入式代理,可以在编辑器、终端、浏览器之间自动切换——例如写前端代码、在终端启动 localhost,再驱动浏览器自己测试。
  • 为了更好呈现这种自主性,Antigravity 还引入了一个 Manager 视图:一个以代理为中心的“任务指挥台”,界面里是多个代理和多个工作空间,你可以在后台放一个代理做调研,前台自己继续开发,通过收件箱和侧边栏异步跟进进度。Antigravity 没有试图把同步开发和异步编排塞进一个窗口,而是优化两者之间的瞬时切换,使开发自然过渡到「异步协作」模式。

反馈(Feedback)

让 80% 工作成果真正变得可迭代,而不是鸡肋

远程黑箱式代理的一个大问题是:不好给反馈。就算代理能完成 80% 的工作,但如果剩下 20% 的修正成本很高,整体就不划算。Antigravity 从本地运行开始设计,强调跨界面、跨 Artifact 的异步反馈:

  • 对文本类 Artifacts(比如实现方案)可以像 Google Docs 一样直接评论;
  • 对截图等可视化 Artifacts 可以框选区域添加评论;
  • 所有反馈会自动被注入代理后续执行流程,无需重启任务或重新对话。

这样,代理不再是“要么完美要么没用”的黑箱,而是一个可以被持续纠偏和共创的协作者。

自我提升(Self-improvement)

把「学习」当成一等公民

Antigravity 把知识管理当成系统级能力:

  • 代理的行为既会 从知识库中检索经验,也会把新的有价值经验写回去。
  • 既包括显性的东西(常用代码片段、抽象出来的架构模式),也包括更抽象的「完成某类子任务的步骤序列」等。

这些知识项可以在 Agent Manager 中查看,并在后续任务中复用,让代理在同一项目环境中越用越“上手”。

产品形态 & 可用性

在当前公测阶段,Antigravity 提供:

  • 个人用户免费使用;
  • 支持 macOS、Linux、Windows;
  • 代理内部可选多种模型:包括 Google Gemini 3、Anthropic Claude Sonnet 4.5 与 OpenAI GPT-OSS,给开发者一定的模型选择空间。

更多特性可以在官方文档中查看,一句话概括,就是官方那句口号:“体验起飞倒数 3…2…1…”——把 IDE 从「智能补全」真正推进到「代理协作开发」的新阶段。

如何使用 Gemini 3 Pro

目前可在 AI Studio[13] 中直接使用(简单模式),在 Build 模式下则会创建一个完整项目,支持预览和推送到 GitHub 仓库。

Image
Image
Image

如何看待 Gemini 3?

从公开信息看,Gemini 3 在数学、科学推理、多模态理解和长时序规划等多个关键基准上表现优秀,部分指标超过 GPT-5.1、Claude Sonnet 4.5 等同代模型,必将引发新一轮 “Google 在性能上重新领跑”的讨论。但从用户使用角度,更值得关注的是:

  • 更深度地嵌入搜索、应用和开发工具:用户与开发者将更加自然地在日常工作流中遇到 Gemini,而不是专门打开某个 “AI 网站”。
  • Antigravity 等 agent-first IDE 走向公开预览:软件开发正从“生成代码片段”向“由智能体协助跑完整任务”过渡(虽迟但到,看来造 AI 浏览器、AI IDE 是每个大厂都必须经历的事了...)。
  • 围绕模型安全、监管与内容生态博弈加剧:搜索流量分配、版权、数据来源等问题不会因为模型性能增强而自动消失。
  • ...

模型不是“会思考的人”,也不是“万能操作系统”。在弄清它擅长什么、边界在哪里之后,用它解决那些原本耗时、枯燥、机械的任务,可能就是这些模型最实在的价值所在。

📌 微信杂谈

昨天群里有朋友在问:ai 编程测试,有没有什么通用的提示词和结果验证方法来判断一个 ai 的牛逼程度。

我简单聊了几句,整理出来:代码本就是感官产物,虽有各种规范,也都是在按照个人风格定制,唯一的标准就是程序运行不崩溃,其次是性能、可维护性、可扩展性等...

我一直认为:在不确定中找确定,是一个玄学问题。为啥说玄学,除 ai 本身黑盒外,在真实编码中,有些甚至不是代码问题,比如重装 node_modules、重启一下电脑就好了...

虽然 ai 有各种基准测试,但我一直认为基准只能覆盖部分场景,真实开发往往是各种需求逻辑混合,交互越复杂,越难给出统一标准(总有抽象问题难以被定义,ai 在理解复杂意图时,总感觉缺少点什么)。就像 gemini 3 的出现也是在解决多模态、细节理解、长时序规划任务等问题。

References

[1]

A new era of intelligence with Gemini 3:https://blog.google/products/gemini/gemini-3

[2]

Humanity’s Last Exam:https://agi.safe.ai

[3]

GPQA Diamond:https://epoch.ai/benchmarks/gpqa-diamond

[4]

ARC-AGI-2:https://arcprize.org/arc-agi/2

[5]

LMArena:https://lmarena.ai/leaderboard

[6]

Vending-Bench 2:https://andonlabs.com/evals/vending-bench-2

[7]

Frontier Safety Framework:https://deepmind.google/blog/strengthening-our-frontier-safety-framework

[8]

AI Safety Institute:https://www.aisi.gov.uk

[9]

model card:http://deepmind.google/models/model-cards/gemini-3-pro

[10]

Google Antigravity:https://antigravity.google

[11]

Cursor:https://www.cursor.com

[12]

Windsurf:https://windsurf.com

[13]

AI Studio:https://aistudio.google.com