PostgreSQL码农集散地

大模型变“啰嗦”了, 是不是资本家故意的?

本期播客

大模型变“啰嗦”了, 是不是阴谋?

当大模型厂商、GPU卡厂商一致认为 token 消耗已成为大模型调用服务的最小计费单位, 这事情就显得不纯粹了.

因为所有人都知道, 同一个意思可以有简洁的表达, 也可以有啰里八嗦浪费token的表达.

现在就有人反映很多大模型的回复过于啰嗦, 浪费token, 厂商是不是故意的?

这些模型越来越啰嗦,到底是为了更好服务用户,还是为了多收一点钱?

大家可以把体感比较啰嗦、简洁的模型打到留言区.

先说结论

把“大模型变啰嗦”一股脑归因为“厂商故意骗 token”,这不严谨;
但如果谁说这里面完全没有利益驱动,那也太天真。

真正的问题,不是 token 计费本身,
而是今天不少模型产品、评测体系、默认参数和商业模式,正在共同把一件事推向同一个方向:

更长的回答,更容易被系统判定为“更认真”“更全面”“更像高质量服务”。

而一旦“更长”与“更贵”绑定,问题就来了。

一、先别急着骂:token 计费,本身有它的合理性

从第一性原理看,大模型服务要消耗的核心资源,不是“回答了几个问题”,而是处理了多少上下文、生成了多少输出。
模型并不理解“字数”,它理解的是 token 序列。OpenAI 官方帮助文档明确说明,API 按 token 计费,且输入、输出、缓存 token 可分别计价;其 API 定价页也明确写明 Responses API、Chat Completions API 等都是按模型的输入/输出 token 费率结算。

这也是为什么主流厂商几乎都沿用了这套逻辑。
OpenAI 官方定价页按每百万 input/output tokens 报价;Anthropic 公开页写明 Sonnet 4.6“starts at 15 per million output tokens”;Google Gemini API 价格页同样按 token 计费。

所以,token 成为结算单位,不是阴谋,而是技术—成本映射下最自然的商业选择。

这一步没毛病。

二、问题出在:同一个意思,长说和短说,价格可能差很多

但合理,不等于没有副作用。

同一个意思,当然可以有极简表达,也可以有“铺垫—分点—举例—总结—补充说明”的冗长表达。
而在按 output token 计费的机制下,更长的输出,往往意味着更高账单。更关键的是,很多模型的 output token 单价,本来就高于 input token。Anthropic Sonnet 4.6 公布的价格里,输出 token 单价就是输入 token 的 5 倍;OpenAI 和 Google 也都把输出 token 作为独立计费维度。

换句话说,
“多说一点”不是文学修辞问题,而是计费问题。

这就形成了一个非常敏感的利益结构:

  • 用户想要的是:更快、更准、更省;
  • 平台天然可能受益于:更长的停留、更高的 token 消耗、更大的账单。

只要这个结构存在,公众质疑就完全合理。

三、但把“啰嗦”直接等同于“故意薅钱”,也站不住

因为大模型变长,未必都是厂商“故意灌水”。

至少有三个更深层的原因。

1. 训练和评测体系,本来就偏爱“看起来更完整”的答案

有研究专门讨论过 verbosity bias(冗长偏好) :
在偏好标注和模型评估中,更长的回答,常常会被打出更高分,即便内容质量并没有本质提升。论文《Verbosity Bias in Preference Labeling by Large Language Models》指出,在其设定下,GPT-4 比人类更偏好更长的答案,这会导致模型学会“把话说长”。

这意味着什么?

意味着很多模型啰嗦,不一定是财务部门下命令,
而可能是训练机制本身,把“长”误学成了“好”。

2. 默认产品策略,往往把“全面”放在“简洁”前面

Google 的 Gemini 提示设计文档就给出过类似范式:
除非用户特别要求简洁,否则回答应当“comprehensively with details”。Vertex AI 的系统指令文档也明确说,系统指令可以指定模型如何回答,比如“确保答案完整,除非用户要求更简洁的方式”。

说白了,今天很多模型的默认价值排序是:

宁可多说,不可漏说。

为什么?
因为从平台视角,冗长最多让人嫌烦;
但如果太短、漏点、答偏,用户会立刻觉得“这模型不行”。

于是,产品团队自然会把系统调到更保险的一侧:多写一点。

3. 复杂任务里,更多 token 有时真的能换来更好结果

OpenAI 的 token 说明文档提到,一些 reasoning models 可能会使用更多内部 token,但目的是提升任务完成效率和结果质量。OpenAI 还给了开发者专门的 verbosity 参数,用来控制回答展开程度,并建议通过清晰的输出约束提升 token 效率。

这说明一个关键事实:

更多 token 不必然等于注水。
在复杂推理、长文分析、代码审阅、工具调用等任务里,适当展开,本来就是质量的一部分。

所以,如果前提条件是:

  1. 任务复杂度高;
  2. 用户确实需要完整推理或细节;
  3. 平台给了明确的简洁控制权;
  4. 额外 token 确实带来了显著质量提升;

那么“回答更长”就是合理的,不该被简单骂成“没节操”。

四、真正值得警惕的,不是长,而是“无效的长”

问题的核心不是字多字少,
而是:

这些 token,到底是在创造信息增量,还是在制造信息泡沫?

这是第一性原理。

衡量一段回答值不值钱,不该看它有多少 token,
而该看它有没有提高用户决策效率。

所以我们可以立一个最朴素的判断标准:

如果新增的 token 没有新增信息、没有新增判断、没有新增可执行性,那它就是浪费。

比如:

  • 明明一句话能答完,却硬拆成“首先、其次、最后”;
  • 明明用户只问结论,却先铺一大段常识背景;
  • 明明没有不确定性,却反复加免责声明和正确废话;
  • 明明只需给做法,却额外生成一堆“注意事项”和“延伸讨论”。

这类“无效的长”,不是服务,
而是把用户时间和预算一起稀释掉。

五、所以,厂商有没有动机把回答做长?

答案是:

有动机,但不能一概而论地认定“都在故意”。

商业上,这个动机非常真实。
当收入与 token 消耗挂钩时,平台当然存在“让默认回答略长一点”的诱因。尤其当行业又把模型能力、GPU 吞吐、云推理成本,统统折算到 token 语言里时,token 不只是技术单位,也成了收入单位。OpenAI、Anthropic、Google 都公开采用按 token 分项定价;而 OpenAI 同时也公开提供“verbosity”这类控制参数,说明“长短”本身已经被产品化、可调参化。

这时候,平台最体面的做法应该是什么?

不是嘴上说“我们为了用户好”,
而是要做到三件事:

第一,默认简洁。
先给结论,再按需展开。

第二,把控制权交给用户。
让用户一键选择:极简、标准、详细。

第三,按结果收费,而不只是按字数收费。
至少在部分场景里,探索任务级、成功率级、工具调用级定价,而不是把一切都压成 token。

如果平台不愿意做这些,却一直把“更长”包装成“更负责”,
那用户怀疑它“既要口碑又要账单”,一点都不冤。

六、如果前提崩塌,结论也要跟着变

这里必须讲清楚一个逻辑边界。

我们前面的判断,建立在一个前提上:

用户要的是“完成任务的最短有效路径”。

如果这个前提崩塌,结论就要调整。

情况一:用户追求陪伴感、启发感,而不是极致效率

那更长、更柔和、更铺垫的回答,未必是坏事。
它满足的是情绪价值,不只是信息传递。

情况二:任务本身高风险

比如法律、医疗、金融、代码安全。
这时过度简短,反而可能是失职。
适度展开,是为了降低误解风险。

情况三:用户本身没有表达清楚需求

模型为了避免答偏,倾向于多补充边界、假设和替代方案。
这也会自然拉长回答。

所以,真正成熟的观点不是:

“模型长就是坏,短就是好。”

而是:

该长的时候长,该短的时候短;
最糟糕的,是不分场景地默认啰嗦。

七、最后一句狠话:别把“认真”演成“注水”

用户今天真正厌恶的,
不是模型输出 token 多,
而是明明可以高密度解决问题,却偏要用低密度文字表演“我很认真”。

这就像一个本可十分钟讲清的方案会,
有人非要开成一小时。
你很难说他一句都没讲废话,
但你也很难说他真在尊重你的时间。

大模型行业也是一样。

按 token 计费没有原罪,
但把“冗长”偷偷训练成默认,把“全面”包装成借口,把“用户买单”藏进产品风格里,这就很难说体面了。

归根结底,
用户买的不是字数,
是结果。
不是段落,
是效率。
不是“看起来很努力”,
是真正帮我把事做完。

谁做不到这一点,
谁就别怪用户骂一句:

为了赚钱,吃相太难看。

小结

你平时用大模型时,最烦它哪种“啰嗦”——
是废话太多、套话太多,
还是明明一句话能讲完,非要给你列五点总结?

你觉得:大模型越来越长,是能力变强了,还是平台在故意放大 token 消耗?你怎么看?