alitrack

视觉领域的 GPT 时刻:DeepMind 用一张图证明「生成即理解」

视觉领域的 GPT 时刻:DeepMind 用一张图证明「生成即理解」

计算机视觉领域有一条持续了十多年的隐性裂痕:生成模型和判别模型,走的是两条平行铁轨。
一边是 Stable Diffusion、DALL·E、Nano Banana Pro——它们能画出以假乱真的图像,但没人觉得它们"懂"自己画的东西。另一边是 SAM、Depth Anything、YOLO——它们是理解和测量的专家,但架构上跟生成模型毫无关系,每个任务都要专门设计一个"解码头"。
这两条铁轨,在 2026 年 4 月 22 日,被 Google DeepMind 的一篇论文焊在了一起。
论文叫 Image Generators are Generalist Vision Learners,模型叫 Vision Banana。何恺明和谢赛宁都在署名作者之列(leadership sponsors)。
它的核心结论只有一句话:训练一个图像生成模型,就等于训练了一个通用视觉理解模型。 你只需要做轻量级的指令微调,把隐藏在生成能力里的理解能力"兑换"出来就行了。

用生成替代检测

Vision Banana 的做法粗暴而优雅。
传统 CV 模型做语义分割,需要一个专门的解码头,把特征图的每个像素映射到类别标签。做深度估计,需要另一个解码头,回归每个像素的物理距离。做实例分割,需要第三个。每种任务一套架构,互不相干。
Vision Banana 的做法:全部扔掉。输出一律是 RGB 图像。
你要做语义分割?Prompt 写:"把猫涂成粉色(RGB 255,192,203),背景涂成黄色。"你要做深度估计?Prompt 写:"生成这个场景的彩虹色深度图。"你要做指代表达分割?Prompt 写:"把那个踮着脚伸手够东西的人涂成绿色。"
一套权重,一句 prompt,全部搞定。
真正的亮点在指代表达分割上。Prompt 说 "the stretching cat is rendered in green, the cat that is cleaning itself is in cyan"——模型需要理解 "stretching" 和 "cleaning itself" 是两种不同的动作状态,而不是两个不同的类别。这需要视觉理解 + 自然语言推理的深度耦合。一个纯"生成"的模型做到了。

怎么把物理距离装进颜色里?

最精巧的工程设计在度量深度估计上。
深度值的范围是 [0, ∞) 米——从你鼻尖到无限远。RGB 的范围是 [0,1]³——一个有限的色彩立方体。怎么映射?
研究团队设计了一个两步的可逆映射:
第一步,幂变换。用 λ=-3 的幂函数把无界深度压缩到 [0,1)。这个参数的选择不是随意的——它故意拉开了近处物体的深度差异(机器人抓取、自动驾驶避障时,5cm 和 10cm 是生与死的区别),同时压缩远处(100 米和 200 米对你来说差不多)。
第二步,3D Hilbert 曲线遍历 RGB 立方体。把压缩后的深度值沿 RGB 立方体的 12 条边缘从黑走到白,形成了一条色彩渐变的"尺子"。这条尺子是严格可逆的——生成的颜色可以直接解码回物理距离,精度无损。
这两步合在一起构成了一个双射:任意深度值唯一对应一种颜色,任意一种颜色唯一对应一个深度值。
结果呢?在 4 个基准测试上平均 δ1 精度达到 0.929,超过了 Depth Anything V3 的 0.918。最狠的是,全程不需要相机内参——训练不用,推理也不用。现有的顶级深度估计模型(Depth Pro、Depth Anything V3、UniK3D)至少需要在训练或推理的某一个阶段知道相机焦距,Vision Banana 完全不管这些,纯靠视觉推理出绝对物理尺度。
更让人头皮发麻的是,它的深度训练数据全部来自合成渲染引擎,零真实世界数据。

一张照片里的金阁寺

论文里有一个非常"不学术"的实验。
一位作者在金阁寺用手机拍了张照片,喂给 Vision Banana,让模型估计画面中一棵树到拍摄点的距离。模型给出的结果是 13.71 米。
然后作者打开 Google Maps 实测——12.87 米。
误差 0.84 米,相对误差仅 6.5%。没有标定,没有激光雷达,只有一张随手拍的照片和一个生成模型。

基准测试:通用模型打败专用模型

数据说话:
2D 分割任务(零样本迁移)

任务数据集Vision Banana最强对手
语义分割Cityscapes (mIoU)0.699SAM 3: 0.652
指代分割RefCOCOg (cIoU)0.738SAM 3 Agent: 0.734
推理分割ReasonSeg (gIoU)0.793SAM 3 Agent: 0.770

3D 理解任务

任务基准Vision Banana最强对手
度量深度4 datasets avg δ10.929Depth Anything V3: 0.918
表面法线Indoor avg mean↓15.549°Lotus-2: 16.558°

在推理分割(ReasonSeg)上,Vision Banana 甚至超过了在训练集上训练的 X-SAM 和 LISA——一个零样本模型打败了有监督训练的专用模型。
更关键的是:轻量级指令微调几乎没有损害原始生成能力。在文本到图像基准 GenAI-Bench 上,Vision Banana 对比原版 Nano Banana Pro 的胜率是 53.5%——甚至还略占优势。

范式意义:比指标更重要的东西

这篇论文的价值不在那几个百分点上。
它的真正冲击在于——它证明了计算机视觉正在经历 NLP 在 2018-2020 年经历的那个时刻。
当年 GPT 用"预测下一个词"学会了理解语言。BERT 证明了双向生成式预训练能解锁深层的语义表征。然后人们发现,只要做一点指令微调,这个"生成模型"就能做翻译、总结、问答、推理——一切 NLP 任务。
Vision Banana 在视觉领域精确复现了这个过程。Nano Banana Pro 用"生成图像"学会了理解视觉世界。轻量级指令微调把这隐含的理解兑换成了可量化的视觉任务能力。
论文 Discussion 部分的原话:

"We could be witnessing a major paradigm shift for computer vision, where generative vision pretraining takes a central role in building Foundational Vision Models for both generation and understanding."

翻译:我们可能正在见证计算机视觉的一次重大范式转移——生成式预训练将成为视觉基础模型的统一底座。

局限:硬币的另一面

当然,现在还远不到"一个模型终结 CV 所有任务"的时候。
第一,推理成本高。作为生成模型,Vision Banana 的推理延迟远高于轻量级专用模型(论文甚至没给出具体延迟数据)。在边缘设备上,SAM 这样的轻量模型仍然不可替代。
第二,只支持静态图像。虽然底层的 Nano Banana Pro 支持视频生成,但 Vision Banana 还没有扩展到视频理解。
第三,实例分割弱项。在 SA-Co/Gold 基准上,pmF1 得分 0.540,落后 DINO-X 的 0.552。多实例检测和分离仍然是一个挑战。
第四,未开源。目前 Vision Banana 作为研究模型发布,没有公开 API 或权重。底层 Nano Banana Pro 可以通过 Gemini API 使用,但指令微调后的版本还没有开放。

视觉研究的"GPT-1 时刻"

如果把 LLM 的发展轨迹映射到 CV——
2018 年的 GPT-1 让 NLP 圈意识到"生成式预训练有用"。2026 年的 Vision Banana 在做着同样的事——它让 CV 圈明白,你不必为每个任务造一个专用模型,一个足够好的生成模型就够了。
接下来的故事,我们已经看过一遍了:更大的模型、更多的模态、更强的涌现能力。Vision Banana 是视觉领域的 "GPT-1 时刻"。
论文最后提出了一个概念——AGI-V(从视觉通向通用人工智能)。如果你觉得这个说法太大了,不妨换个角度想:
十年前,你需要三四个独立模型才能完成"看到→分割→测距→理解"这一套组合操作。今天,一个模型、一套权重、换一句 prompt 就够了。
这就是范式的力量。