程序员老鬼

MCU,为AI智能体打造的“全能副本试炼场”

说到通用AI智能体,很多模型的表现其实是“看起来很聪明”,但真丢进一个开放世界里,它们经常就“脑抽”了。Minecraft 作为模拟开放世界的绝佳平台,能不能成为评测AI能力的“试金石”?CraftJarvis 团队给出的答案是 MCU(Minecraft Universe)。

图片

这个MCU不是复仇者联盟,是个专门为AI设计的任务生成和评估平台。它不是让模型记套路、刷分数,而是用“世界级混乱”逼你AI真正长脑子。

无限任务组合,告别“练一题背一题”

以前Minecraft里的AI评测,大多只围绕“挖钻石”“合成道具”“造个家”这些固定任务。MCU则直接暴力上限,做了一个涵盖11大类、41子类的超大原子任务库,可以随机组合成无数种任务场景。

图片

什么“在沙漠建水上屋”“雨天徒手采集木材”,这都只是入门级操作。每个任务都拆得足够细,专门测AI的推理、控制、创造等能力。对模型来说,没有哪一题是“看过就会”的。

GPT和VLM帮忙:任务生成和评估全自动

以前评测AI要人盯着看,给打分,效率慢得要命。MCU用GPT-4o来自动生成任务,设定天气、生物群落、起始道具,AI从出生那一刻就被安排明明白白。

图片

评分这块也牛,VLM负责六大维度的打分,比如策略好不好、是否出错、有没有创造性。效果甚至比人评还准,准确率高达91.5%,速度快了8倍,成本降到原来1/5。别的评测还在翻代码、看录像,MCU这边已经发榜了。

图片

任务越怪,越能逼出真本事

我特别喜欢它设计的那些“极限任务”。比如“在熔岩边上造瀑布”“夜晚在雨林躲怪杀羊”这种事,人干着都头大,更别说AI了。这种自由度+高难度组合,对AI泛化能力简直就是暴击测试。

你做过的事不管用,背过的套路没用,模型只能靠真理解和即时推理。MCU就是逼着AI跳出训练集,靠自己判断怎么活下去。

目前的SOTA模型一进去就栽

为了验证平台强度,团队把GROOT、STEVE-I、VPT这类主流Minecraft智能体都拉进来测了一遍。结果很明显,这些模型在“任务组合”和“陌生场景”下全线掉线。

就拿“在房间里睡觉”这个任务来说。只把床搬进屋子,GROOT就开始迷惑操作:点错箱子、原地转圈、甚至直接跑了。这种“微变化引发脑抽”,暴露了模型对环境的理解其实很浅。

更夸张的是,那些看起来能打的模型,在“建造”和“战斗”这类任务里的“创造性”和“错误检测”得分,几乎全是垫底。这也说明,它们根本不具备人类那种“看问题、想办法、重新来”的能力。

图片图片图片图片

不只是评分,更是找方向

MCU 不是来吓唬模型的,而是帮我们识别通用智能体到底还差什么。它新加的“任务进度评分”比传统的“完成/失败”更精细,能看出模型虽然没完成任务,但有没有在朝对的方向努力。

总结一句话:MCU就是那种“不会放水”的老师,出题不讲套路,打分还毒舌,但你只要在它这儿混得好,那你在开放世界AI里就有话语权了。对现在这个AI天天拼“谁泛化强”的时代,MCU的出现,来的刚刚好。

最后,我为大家打造了一份deepseek的入门到精通教程,完全免费:https://www.songshuhezi.com/deepseek

也可以看我写的这篇文章《DeepSeek满血复活,直接起飞!》来进行本地搭建。

-END-

ok,今天先说到这,老规矩,给大家分享一份不错的副业资料,感兴趣的同学可以链接我,微信:hls404 找我领取。

以上,就是今天的分享了,看完文章记得右下角点赞,也欢迎在评论区写下你的留言。