alitrack

不用换模型,换个壳就能省一半成本

Databricks 最近公开了一份内部基准测试,把 AI 编码工具丢进自己的百万行代码库里跑了一轮。结论出人意料:同一个模型,套上不同的"壳",成本能差 2 倍。

先说背景。7 月 8 日,Databricks 的 Matei Zaharia(Spark 创始人)团队发了一篇博客,没有用 SWE-Bench 这种公开基准——理由是题目早就泄露进训练数据了。他们从几千个内部工程师的真实 PR 里筛选了高质量任务,构建了自己的封闭测试环境。

然后他们做了一个关键实验:把同一个模型(Claude Opus 4.8)放进不同的 Agent 框架里跑。

结果:

  • Claude Code(Anthropic 官方 CLI):基准成本
  • Pi(一个极简的开源 agent 库):成本低 2x,成功率完全一样

怎么做到的?

Pi 的作者 Mario Zechner 的设计哲学就一句话:bash for everything。没有几十个工具描述、没有冗长的 system prompt、没有每轮都传一遍的完整文件树。Pi 每轮传给模型的上下文只有 Claude Code 的 1/3。

这意味着什么?一个 20 轮的任务,Claude Code 累计喂给模型的上下文里,有大量是工具定义的重复序列化、无关的历史文件内容、以及永远不会被用到的 domain 工具描述。Pi 砍掉这些之后,模型反而更聚焦——上下文精炼了,决策也快了。

更反直觉的还在后面。

Databricks 还比了 Sonnet 5 和 Opus 4.8。Sonnet 的 token 单价便宜 1.7 倍,直觉上应该更省钱对吧?错了。在真实任务上,Sonnet 平均每个任务花 $2.09,Opus 只花 $1.94。原因:Sonnet 为了找到正确方案反复读文件、来回试探,多消耗了 1.9 倍的 token。任务成功率还低了 6 个百分点(81% vs 87%)。

Token 单价是最误导人的指标,没有之一。

还有一个值得注意的数据:GLM 5.2,开源模型,配 Pi 的 harness,任务质量匹敌 Opus 4.8,但单任务成本只要 $1.28(Opus 是 $1.94)。开源模型在真实企业代码库上,已经进入了第一梯队。

Matei Zaharia 自己在 X 上总结得很直白:

"Harnesses make a huge difference in cost-performance. The very simple Pi harness got the same success rate as harnesses from the LLM vendors with Opus and GPT 5.5, but at 2x less cost! Seems to be mainly due to smaller inputs to the LLM."

Databricks 甚至为此专门投资了 Omnigent,一个"元 harness",让开发者可以在不同模型和框架之间自由切换而不用锁定任何一家。

三条核心结论:

  1. 01壳比模型更影响成本。
     同一个 Opus 4.8,Pi 能便宜 2x。上下文管理是成本的第一杠杆。
  2. 02Token 单价是骗局。
     Sonnet 单价低但总成本高,因为它 token 效率差。选模型要在真实任务的"成本-质量"帕累托前沿上决策,不能只看价格标签。
  3. 03开源模型已进第一梯队。
     GLM 5.2 + Pi harness 的质量不输 Opus,成本只要 66%。

如果你是个人开发者,现在应该问的不是"换哪个模型",而是"我的 agent 框架每轮喂了多少冗余 token"。砍上下文比砍模型单价更值钱。


参考:Databricks Blog (2026-07-08), Matei Zaharia X Thread, r/LocalLLaMA, Hacker News 讨论