告别羊驼时代,扎克伯格的AI豪赌终于交卷
52分,这是Meta新旗舰模型Muse Spark在Artificial Analysis综合智力指数上的最终得分——从Llama 4 Maverick的18分跳到52分,跻身全球前五,仅次于Gemini 3.1 Pro、GPT-5.4和Claude Opus 4.6。
这场翻身仗来得并不容易。
去年4月,Llama 4在第三方评测中翻车,扎克伯格当机立断宣布成立Meta超级智能实验室(MSL),斥资143亿美元收购Scale AI 49%股权,挖来其创始人Alexandr Wang担任Meta首任首席AI官,从OpenAI、Anthropic、Google等对手挖来大量顶尖研究员。9个月间,Meta将整个AI技术栈——训练基础设施、推理架构、数据管线——全部推倒重来。
Muse Spark就是这场豪赌交出的首份答卷。
算力效率上,Muse Spark在达到Llama 4 Maverick同等性能时,所需计算量减少了十倍以上。架构上,它是原生多模态模型,视觉信息从底层深度融合逻辑链,而非后期拼接,拍照即可生成数独游戏或识别菜品营养成分。应用上,Meta与超过1000名医生联合训练,使Muse Spark在HealthBench Hard开放式健康问答中得分42.8,超越GPT 5.4的40.1和Gemini 3.1 Pro的20.6,成为该领域最强模型之一。
Muse Spark还推出了“沉思模式”(Contemplating),最多可调动16个智能体并行推理,在Humanity's Last Exam中借助外部工具拿下58.4分。
值得注意的是,Muse Spark彻底告别了Meta此前的全面开源路线。模型仅通过Meta AI网页端和移动应用提供,API仅向部分合作伙伴开放私有预览。这被外界解读为Meta商业变现的关键一步——既要防止核心能力被竞争对手借鉴,也需通过闭源API支撑每年数百亿美元的AI投入。
当然,Muse Spark并非全能。在抽象推理和编程类任务上,它仍与OpenAI、谷歌和Anthropic的顶尖模型存在差距。
但在扎克伯格看来,52分和10倍效率提升只是起点。他提前管理了外界预期:“我们的第一批模型会很好,但更重要的是,它将展示我们所处的快速发展轨迹。”
从开源旗手到闭源实战,从Llama到Muse——Meta的AI故事,正在翻开全新一页。