MacTalk

豆包 Seed 2.0 来了:字节模型跨越鸿沟

豆包大模型 2.0(也就是 Doubao Seed 2.0)春节前就发布了,当时我用扣子编程体验了一把 2.0 的编程能力,还写了篇文章:字节 Seed 2.0 来袭,不过我想先和你聊聊扣子编程。

春节后回来,打开常看的 https://arena.ai 模型榜单,果然,在最基础的 Text 领域,Dola-Seed-2.0-Preview 成了唯一一款进入前十的中国大模型。Dola-Seed-2.0-Preview 对应的正式版就是字节刚发布的 Doubao Seed 2.0。

Image

Seed 2.0 不仅拿下了国内综合第一,它的视觉能力也只排在 Gemini 三个版本之后,位居全球第四。考虑到 Seed 2.0 的输入成本大约只有 Gemini 的五分之一,这个模型在多模态理解这件事上,几乎就是一个自带降本增效光环的神器了。

我得好好看看这个模型有啥好东西了。

过去一年,“多模态”这个词被用得有点多,不少人对多模态的理解还是 AI 能够描述图片和视频里有啥,但之后怎么做事,还有一条工程化的鸿沟。

Seed 2.0 这次想跨过去的,恰恰就是这条沟。

这次字节跳动给 Seed 2.0 的定位是全新的多模态 Agent 模型,更强多模态理解,比如高精度文字提取、图表理解、空间/运动理解、视觉知识推理、长视频理解,同时包括企业级的 Agent 能力,包含对 Skills 的理解与应用增强;Function Call、多轮指令遵循、搜索和工具调用显著增强;格式输出更稳定;上下文管理更灵活,能支撑企业级复杂、长程任务等等,以及更强推理与代码能力,尤其提到前端开发提升明显(这个我们在扣子编程里已经简单体验过)。

可以清楚的看到,Seed 2.0 一方面在做多模态理解能力的全面升级,另一方面在增强 LLM 与 Agent 在真实世界执行任务的能力。前者让模型更好的理解世界,后者让模型更好的交付任务,也就是把原生多模态的感知、理解、规划、工具调用、再到产出物,固化成稳定的系统,最终形成从“看懂世界”到“产出结果”的完整能力。

不废话咱们直接上案例:

1)让 Seed 2.0 为 2010 年世界杯上的“冤案”平反

2010 年世界杯 1/8 决赛英德大战里,兰帕德有一次射门击中横梁后弹地,慢动作显示皮球整体越过门线近半米,但当值裁判并未判罚进球,英格兰最终以 1-4 告负。那届世界杯尚未引入门线技术(GLT),也正是这次争议判罚,直接推动了 GLT 在 2014 年世界杯上的正式落地。

我把这个视频喂给 Seed 2.0,提示词是:

视频中的这粒"疑似进球",裁判并没有吹哨。请逐帧分析视频中足球击中横梁后的落点。结合足球的运动轨迹、物理反弹轨迹、落点、以及门线的位置,判断这颗球是否完全越过了球门线,这粒进球是否有效。并详细阐述你的理由。

测评目标:视频理解、空间理解、运动理解、视觉知识与推理

这个案例需要 Seed 2.0 识别球的运动轨迹、识别碰撞后的反弹轨迹(物理直觉)、判断球落点与门线的空间关系,最终给出结论:是否整体越线。

Seed 2.0 出色的完成了这个任务:

Image

对“长视频和运动理解”非常到位:

Image

这个案例的意义,其实和足球无关。当视频理解从“讲解员”升级为“取证员”,模型已经有能力把“看到”变成“证据”了。

2)根据手绘地图做旅行规划

打开豆包的专家模式(Seed 2.0),给它看一张云南手绘地图:

Image

我的提示词是:

1、识别地图中的城市和景点

2、调用天气 API 查询每个城市未来 3 天的天气

3、调用交通 API 查询城市间交通方式

4、根据预算 20000 元的约束,生成一份完整的 7 日游行程规划

评测目标:VLM 空间理解 + 多 Skills 调用(天气、交通、行程规划)、复杂任务分解与规划能力、Function Call 的准确性。

Seed 2.0 标记了地图上的所有城市和对应景点:

Image

给出了核心城市的准确天气预报:

Image

核心城市间主流交通方式、时长&费用等:

Image

最后 Seed 2.0 给出了完整的 7 天旅行计划和预算总表:

Image

这一系列的长任务完成得堪称完美。

3)基于老师的课堂板书,识别教学内容,生成一个小游戏,增加趣味性,巩固教学知识

这是两个有点潦草的课堂板书,信息密度高、噪声也高,单词、例句、语法结构、临时补充、老师随手划的痕迹、箭头、圈圈点点……人能一眼抓主线,Seed 2.0 能不能精准识别内容并完成我的任务呢?

Image

打开 AI IDE,配置好 Seed 2.0,把图片喂给模型,提示词如下:

这里是一个三年级小朋友英语课的课堂板书(2 张图片),第一张图片是本节课涉及到的单词,第二张是涉及到的语法。

请你帮我根据本节课的学习内容,生成一个网页游戏,用来帮助小朋友复习本节课的单词与语法。

这个网页游戏包含 4 个情节,完整组成了一个小故事(譬如一趟旅程,经历不同的地点产生不同的对话,进而涉及不同的单词与语法)。

小朋友作为游戏主人公,经历每个情节,每个情节。

每个情节中的场景对话不要太难,2-4 句,应该是三年级小朋友能够理解的。

4 个情节合计起来,应该完整覆盖本节课的单词与语法。

每个情节中的场景对话中,针对本节课的单词与语法,应该着重展示。

每个情节中的场景对话,应该有对应的音频,可以朗读以及重听。

整个小故事结束,应该有个简单的庆祝动画,作为整个游戏的 ending。

使用 React + Tailwind 生成对应的响应式网页。

从板书中识别出本节课的单词与语法知识点,然后基于知识点规划一个冒险游戏的 Plan:

Image

遵循 Plan 逐项完成,最终完成整个冒险游戏:

Image

最终的效果如下:

在整个过程里让我感到惊喜的地方:

1、这堂课的单词集中在衣物、穿着上, 我在提示词里说分成 4 个场景, Seed 2.0 最终设计的游戏,结合了一年四季体现这 4 个场景,贴合的非常巧妙。

2、不同季节的场景切换,背景色调也会跟着变换,冬天甚至有雪花效果。

3、庆祝动画的烟花效果,以及单词回顾、重听环节,也完美匹配了提示词中的要求,细节很棒。

一个结论:多模态的终点,是“可交付的生产力”

把这些案例放在一起,我能看到 Seed 2.0 的一条清晰路线:把“杂乱的视觉信息”变成“结构化知识 + 小游戏”;把“视频”变成“逐帧证据 + 推理解读”;把现实世界的输入,转成可以复用、验证和交付的产品。

我想,这才是“多模态 Agent 模型”应该有的样子:理解这个真实的世界,把图文音视频的输入,转化成一个可以运行的 App、一个可复核的证据链,或者一份能够接入业务流程的成果。原生多模态的能力,在 Seed 2.0 这里有了淋漓尽致的表现。

还有件事我想说一下,最近 Claude 的母公司 Anthropic 一直在提国内模型的蒸馏问题,行业里关于“抄捷径”这件事也吵得很凶,这时候再看 Doubao Seed 2.0,会发现它走的是另一条路:不靠简单的蒸馏去换个指标,而是把重心放在原生能力和方法论上。

从 Seed 2.0 的技术报告里可以明显看出来,字节真的在认真分析用户到底需要什么,Seed 2.0 一直强调的是指令遵循、长尾知识、以及真实世界复杂工作流的表现,他们做了大量自建 benchmark 和 in‑house 评测,把业务里的真实任务场景固化下来长期优化,而不是专门去刷评测榜单。

这背后是个长期心态。过去两年,字节在不同架构方向上持续有研究成果,对“怎么做一个能在真实世界长期工作的模型”这件事,比对“怎么快速做一个好看故事”更上心。事实上字节的营收和增长速度也让他们有足够的自信做个长期主义者。

最后是个好消息。为了解决 Agent 时代 Tokens 使用量爆炸的问题,火山引擎也第一时间更新了 Coding Plan 套餐包。现在开发者可以在火山方舟 Coding Plan 里直接调用 Doubao Seed 2.0 Code,新用户首月最低 8 元,即可根据不同的编程任务自由切换、匹配最合适的模型。

识别二维码或者通过图片下方“阅读原文”链接,均可订阅。

Image