Seed 2.0刷新Arena榜单,国产模型排名最高
这几天国产大模型有点猛。
前几天我们报道了自 2024 年 5 月正式发布以来,字节大模型首次大版本的跨代升级 ——Seed 2.0。
今天就在 LMArena Leaderboard Changelog 上注意到了它取得的成绩。
简单来说,Seed-2.0 首次参加 LMArena(现在的 Arena),就在文本竞技场排名第 6,视觉竞技场排名第 3,均为国产大模型最高排名。
想来也正常,作为一个原生的多模态模型,Seed 2.0 在多模态理解等多个维度上都有极大的提升。
前几天报道时我们也迅速浏览过其技术报告,取得成绩就已经非常显著:
1.在数学与视觉推理方面,Seed 2.0 Pro 在 MathVista、MathVision、MathKangaroo、MathCanvas 等数学推理基准上达到业界最优水平,在科学领域的整体成绩与 Gemini 3 Pro 和 GPT 5.2 相当。
2.在 VLMsAreBiased、VLMsAreBlind、BabyVision 等视觉感知能力基准中,Seed 2.0 取得了业界最高分。
3.在推理和 Agent 能力评测中,Seed 2.0 Pro 在 IMO、CMO 数学奥赛和 ICPC 编程竞赛中获得金牌成绩,也超越了 Gemini 3 Pro 在 Putnam Bench 上的表现。
4.在 HLE-text(人类的最后考试)上,Seed 2.0 Pro 取得最高分 54.2 分。
这两项榜单的优秀成绩,结合我们先前的体验,确确实实能感受到 Seed 2.0 大版本升级所带来的性能提升。
另外,有消息称今晚阿里千问将开源 Qwen3.5,不知能取得怎样的战绩呢?