阮一峰的网络日志

腾讯混元 Hy3 + WorkBuddy 实测,300B 模型能力比肩 700B GLM 5.1

一、引言

本周,腾讯发布了全新的混元大模型 Hy3。

Image

混元作为腾讯自研的主力模型,过去三年只发了两个版本:2023年9月的1.0版,2025年12月的2.0版。

现在,终于迎来了第三个版本,自然引人关注。而且,新版本做了重大调整,模型定位发生了变化(详见下文),有很多看点。

腾讯显然对它寄予厚望,4月份就公开了预览版 Hy3-preview[1],供大家测试,提前预热。根据发布公告,正式版的编码能力和 Agent 能力,比起预览版又有大幅提升。

而且,今年3月腾讯还推出了配套工具 WorkBuddy[2]。

Image

WorkBuddy 的官方定位是“桌面的 AI 原生工作台”,支持各种 AI 使用场景。它有点类似 Claude Code 国内版,结合 Hy3 模型,据说是大部分任务的高性价比之选。

现在只要在 WorkBuddy 里面使用 Hy3,就有两周的免费期。

Image

上图就是 WorkBuddy 内置的可供选择的模型。

我利用这段免费期,测了一下 Hy3 + WorkBuddy 的组合,到底是不是像宣传的那样好用。

作为对比,我从 WorkBuddy 的内置模型里面挑选了 GLM 5.1 和 DeepSeek 4 Flash 来 PK。

为什么选择它们作为 PK 选手,而不是更新更强的模型,我来解释一下,这跟 Hy3 的模型定位有关。

二、模型定位

关于 Hy3,大家需要了解的第一点就是,它只是一个中等规模的模型,甚至可以说是小规模的模型,绝对不是那种超大规模的大模型。

它采用混合专家模型(MoE)架构,总参数 295B,运行时激活的参数 21B,上下文长度 256K。

这个参数规模比较小,表明它内部的运算量肯定也不大,一定比不了那些运算规模极大的 SOTA 模型。

但是根据腾讯公布的测试分数,它的得分并不那么低。

Image

上图最左边就是 Hy3 的 SWE-bench Pro 得分,大概是位居中游。

发布公告这样说:“它展现出显著强于同尺寸模型的智能水平,并比肩更大尺寸旗舰模型的效果,大幅提升了在各类产品和生产力任务中的实用价值。”

我翻译一下这句话。腾讯认为 Hy3 的价值在于,相比同等尺寸(即中小规模)的模型,它的表现更好。而且,由于它的参数相对少,所以运算量小、成本更低、速度更快,因此具有更大的使用价值。

为了验证这句话是否属实,我选了两个跟它规模相近的国产模型,与它进行对比:GLM 5.1 和 DeepSeek 4 Flash。

Image

从参数数量看,GLM 5.1 的计算量最大,混元 Hy3 其次,最后是 DeepSeek 4 Flash。

我的实际测试感受也是如此,DeepSeek 4 Flash 速度最快,混元 Hy3 其次,GLM 5.1 最慢。

由此可见,混元 Hy3 的设计思路不是追求最强的性能,而是追求性能和成本/运算速度的平衡,成为一个性能不错、成本较低、速度较快的、可以日常主力使用的模型。

下面就是我做的五轮测试,可以先说结论,混元 Hy3 的表现令人刮目相看,完全看不出它是一个中小规模的模型。

三、BridgeBench 测试集

我的测试题主要来自 BridgeBench 测试集[3],它是目前最热门的测试基准,号称“全球排名第一的氛围编程测试基准”。

Image
Image

它一共170余道题,专门测试模型的代码能力。

它的运行方法和评分方法,都没有公开,但是部分测试题[4]是公开的。我选择了一些题目,上面三个模型都跑一下,看谁的表现最好。

不过,这些题目都相对复杂,跑起来太费时间,有时一道题要跑一个小时。所以,前面两轮简单测试,我就用自己收集的测试题[5]了。

另外,以下所有测试都是在 WorkBuddy 里面完成的。我只是切换模型和工作目录,其他条件都保持不变。

四、网页 UI 测试

第一个测试最简单,先看一下模型生成网页 UI 能力,要求重构网页,使其成为美观有效的商务网站入口页(提示词[6])。

混元 Hy3

Image
Image
Image

GLM 5.1

Image
Image
Image

DeepSeek 4 Flash

Image
Image
Image

显然,这三个模型的表现都很好,我觉得分不出差距。

对于大模型来说,生成网页 UI 应该算已经解决的问题了,已经不足以考验模型能力了,以后大概不用再测了。这里就是向大家展示一下,模型生成的网页样式和美感。

唯一可挑剔的,就是它们明显都用了 Tailwind 的模版或技能,导致看上去很雷同,没有个性。幸好生成的是商务网站,如果是个人网站,就太乏味了。

五、网页 2D 游戏《愤怒的小鸟》

第二个测试是生成网页版的《愤怒的小鸟》(提示词[7])。这个测试其实难度很大,尤其是小鸟的飞行和碰撞效果。

混元 Hy3

Image
Image
Image

这是我测过的最佳结果之一,页面跟原始 UI 很接近,游戏完全可玩,小鸟的飞行和碰撞效果逼真,小鸟落在地面上会反弹,砖块被碰撞后会消失。

GLM 5.1

Image
Image
Image

这个结果也还可以,虽然 UI 跟原始游戏有差距(没有出现小猪),但是小鸟的飞行效果做得很好,尤其是玻璃碰撞后的粉碎效果很漂亮。

Image
Image

DeepSeek 4 Flash

Image
Image

这个结果也是可玩的,但是明显比其他两个模型逊色,无论是 UI 还是游戏的动画效果。

至于混元 Hy3 和 GLM 5.1 的比较,我个人感觉,前者更好一些,还原了原作,还原度更高。

六、2D 台球游戏

这个测试要求使用 Python 语言,生成一个 2D 的台球游戏(提示词[8])。

测试要求是只使用 pygame-ce 和 numpy 这两个软件包,前者负责处理游戏窗口,后者负责处理台球碰撞的数学计算。

混元 Hy3

Image
Image
Image

这个结果出乎意料的好,画面精美,游戏完全是可玩的,碰撞效果逼真,可以逐一将球打落袋。

GLM 5.1

Image

这个结果完全失败,台球就是黑色方块里面一个平面的圆,甚至方块的四角都没有去除。

Image

而且,这个游戏不可玩,无论我怎么尝试,始终无法用球杆将白球击出。

DeepSeek 4 Flash

Image
Image

这个结果还可以,也是可玩的。但是,开球方式不对,是横过来开球,而且很难操作,需要鼠标来瞄准,然后用 Space 键击出(鼠标左键无效)。

显然,这一轮的赢家是混元 Hy3。

七、3D 鹈鹕骑自行车

这个测试要求使用 GLSL 着色器语言,生成 3D 的“鹈鹕骑自行车”场景(提示词[9])。

模型生成的将是一个 GLSL 脚本,把它贴到 shardtoy.com[10] 进行在线编译就能看到渲染结果。

混元 Hy3

Image
Image

GLM 5.1

Image
Image

DeepSeek 4 Flash

Image
Image

这一轮,三个模型的生成结果,都不算很理想。混元 Hy3 相对还好一点,但是自行车更像平衡车,由于提示词是英语 Bicycle,我不知道这个词是否还包括两轮的平衡车,否则就很难解释这种形状。

GLM 5.1 的自行车就更奇怪了,轮子成了水平的转盘,这是水上自行车吗?至于 DeepSeek 4 Flash,完全没有生成鹈鹕。

八、大型 3D 网页游戏

最后是最难的测试,要求模型生成大型的复杂网页游戏。

我先测了生成《MineCraft》,要求所有代码包含在单个的 HTML 文件(提示词[11])。

混元 Hy3

Image
Image
Image

虽然画面比较简陋和残缺,但是游戏要素是完整的,你看得出来这是 MineCraft,一个开放的动态世界,可以无限漫游,使用 wasd 这四个键进行移动。

你甚至可以砍树收集材料。

Image

相比之下,其他两个模型的生成结果,就有点惨不忍睹。

GLM 5.1

Image
Image

DeepSeek 4 Flash

Image
Image

虽然都很糟糕,GLM 5.1 生成的至少还是一个 3D 世界,可以四处移动,DeepSeek 4 Flash 生成的就是一个黑屏,什么也没有,也无法操作。

我怀疑是不是测试过程有问题,于是又测了生成 3D 开放世界《罪恶城市》(提示词[12])。

混元 Hy3

Image
Image
Image

我觉得这个城市的视觉效果还不错,可以第一人称视角无限漫游,右上角还有实时地图。

另外,路上还有行人,你可以按键发射子弹,同时听到音效。

Image

GLM 5.1

Image
Image

DeepSeek 4 Flash

Image
Image

GLM 5.1 直接黑屏,DeepSeek 4 Flash 能运行,但画面一点看不出是个城市。可以确认了,这两个模型在 3D 网页游戏方面的能力比较弱。

九、总结

经过这些测试,混元 Hy3 的表现让人眼前一亮,简单的任务不成问题,复杂的任务也能生成可以接受的结果。

它(300B 模型)的表现明显好于 DeepSeek 4 Flash,很多时候也好于参数数量远大于它的 GLM 5.1(750B 模型),至少不比它差。

考虑到 Hy3 尺寸更小,运行速度占优势,而成本也低,它的 API 定价是百万 Token 输入/输出为 1元/4元,确实是一个性价比很突出的模型。

它以小模型的价格,却有着越级的表现,各方面比较均衡,完全可以作为日常主力的编程/Agent 模型使用。

而且,现在通过 WorkBuddy[13] 使用 Hy3 是免费的,我认为完全值得大家去试试这个模型。

(完)

References

[1] Hy3-preview:https://www.tencent.com/zh-cn/articles/2202320.html
[2]WorkBuddy:https://www.codebuddy.cn/work/
[3]BridgeBench 测试集:https://www.bridgebench.ai/
[4]部分测试题:https://www.bridgebench.ai/test-prompts
[5]自己收集的测试题:https://github.com/ruanyf/ai-test-case
[6]提示词:https://github.com/ruanyf/ai-test-case#case01
[7]提示词:https://github.com/ruanyf/ai-test-case#case03
[8]提示词:https://www.bridgebench.ai/prompts/c4541e6f-be24-4b0b-ad5e-9ae5b8cfc1b7
[9]提示词:https://www.bridgebench.ai/prompts/64269eb6-6691-4d05-9489-91fb7f4ddf08
[10]shardtoy.com:https://www.shadertoy.com/
[11]提示词:https://www.bridgebench.ai/prompts/e3aca9dc-5d6d-4002-ab9c-76267f9689b2
[12]提示词:https://www.bridgebench.ai/prompts/709d9a91-7406-4240-8b23-ef4a456c385c
[13]WorkBuddy: https://www.codebuddy.cn/work/