Vue中文社区

Token 全面涨价,我养不起小龙虾了,让我来让 Token 账单砍 72%

说句"你好",7300 Token 没了。 我发现我订阅的 腾讯云 coding plan,被替换成了 token plan,然后提示我余额不足!揪心,再这样我要养不起小龙虾了。

有人算过账:一个月 4000 万 Token,账单 ¥1200。拆开一看,72% 花在心跳上。你在睡觉,它在花钱。

龙虾贵在哪?有没有更省的方案?

无限自助餐没了

Coding Plan 集体退场。阿里百炼 Lite 上线 23 天停售,腾讯云 Coding Plan 直接转 Token Plan,智谱两个月内涨价 30% + 砍额度 + 停老套餐。国外也一样——GitHub 暂停 Copilot 新注册,Cursor 上线 $200 Ultra 档,GitHub 官宣 6 月起全面转 Token 计费。

Token 变成硬通货了。 谁能省 Token 谁就有优势。

全场涨价的时候,DeepSeek 反向降价。V4 系列定价:

模型
缓存命中输入
缓存未命中输入
输出
上下文
V4 Flash¥0.02/M
¥1/M
¥2/M
100 万
V4 Pro
(2.5 折)
¥0.025/M
¥3/M
¥6/M
100 万

对比 GPT-5.5 Pro 输出 0.28/M——千分之一点五。发布 48 小时内又连砍两刀,2.5 折优惠延长到 5 月底。

这个价格差是后面所有省钱方案的基础。

四个吞金黑洞

Token四大吞金黑洞

入场费:系统提示词的固定开销

每次调用 OpenClaw,不管你问什么,AGENTS.md、SOUL.md、各种规则和工具描述先塞一遍。合计 7300 Token。

你问它"今天天气怎么样",它也得先把这堆东西读完再回你。一天调 60 次,光入场费 43.8 万 Token。一个月仅这一项 ¥140。

心跳:最大元凶,占 72%

OpenClaw 有个心跳机制——你没在用,它每 15 分钟自己跑一次。

每天 96 次 × 约 10,000 Token/次 = 96 万 Token/天。

一个月:2880 万 Token,占总消耗 72%。

你上班 8 小时用它干活,另外 16 小时它自己空转烧钱。什么都不干,一天 ¥145 没了。

36 氪那篇文章标题写得直白:月薪两万都养不起龙虾。我反正养不起。

上下文膨胀:滚雪球

OpenClaw 的记忆机制是把对话历史往上下文里塞。用得越久,上下文越长,每次调用越贵。

第 1 天,一个问题消耗约 2000 Token。第 30 天,同样的问题,45,000 Token。

22 倍。干的活一模一样,花的钱天差地别。

大炮打蚊子:模型不分级

心跳检查、简单状态查询、格式化输出——这些"跑腿活"也拉顶配模型来干。

用 Claude Opus 跑心跳 vs 用 DeepSeek V4 Flash 跑心跳,成本差 15 倍。

但龙虾默认不区分。所有任务一个模型一个价,心跳也用 Opus。这钱花得属实冤枉。

Harness 的思路

有个公式:Agent = Model + Harness。

Model 是大模型。Harness 是模型之外的所有东西——提示词怎么组织、记忆怎么管、技能怎么加载、上下文怎么控制。

Vivek Trivedy 说过:大多数人盯着 Model 省钱(换便宜模型、砍推理次数),但真正该动刀的是 Harness 那一层。

Token 爆炸的三类根因:

类型
表现
龙虾的做法
注入型
先把所有东西塞进去再说
系统提示词 7300 Token 固定开销
重复型
该记住的没记住,反复搜
上下文越用越长,同样问题 22 倍膨胀
黑盒型
不知道钱花在哪
心跳占 72% 但用户感知不到

水龙头没关严,一天漏一滴,觉得没什么。月底看水费账单——地板泡了一个月了。

分层记忆:记住该记的,扔掉该扔的

龙虾:每次对话把所有历史塞进上下文。越用越长,越长越贵。

Hermes Agent:三层记忆分离,按需加载。

记忆层
存什么
怎么用
举个例子
情景记忆
发生过什么
FTS5 全文索引,按关键词召回
"上次部署遇到端口冲突"
语义记忆
你是谁、偏好是什么
持久化状态,每次自动注入
"用阿里云 ECS + Nginx 反代"
程序性记忆
怎么做某件事
Skill 文件,按需加载
deployment-checklist.md

新对话开始,Hermes 不把过去所有历史塞进去。它根据你当前说的话,去 SQLite 里做全文检索,只拉相关的几条。

积累几个月对话,也不会变慢或变贵。

数据:分层记忆 + 动态加载,Token 消耗降低 40-60%。道理也简单——你不会每天出门把全部家当背上吧,带今天用得到的就够了。

Skill 文件 = 压缩后的经验

你跟 Agent 聊了十次怎么部署项目,踩了各种坑。龙虾每次把这十次对话全塞进上下文。

Hermes 不一样:十次对话的教训压缩成一个几十行的 markdown 文件(Skill),下次遇到类似问题只加载这个文件。

十次对话 5 万 Token。一个 Skill 文件?几百 Token。

龙虾是每次把整本笔记本翻一遍,Hermes 是翻目录找那一页。

渐进披露:技能别一股脑全塞

记忆之外,技能加载也是个大头。

很多 Agent 框架启动时把所有工具的完整描述全塞进系统提示词。工具越多,提示词越长,每次调用固定开销越大。

Hermes 用了一个叫"渐进披露"的机制,分三层加载:

层级
加载内容
Token 开销
Level 1
工具名 + 一句话描述
~100 Token / 个
Level 2
完整参数说明和使用指令
< 5,000 Token
Level 3
资源文件、示例代码
按需加载

启动时只加载 Level 1。模型判断需要哪个工具,再展开那个的 Level 2。真正执行了才加载 Level 3。

从平均 15,000 Token/次 降到 3,000-5,000 Token/次,省了 66-80%。

怎么写技能描述才省 Token?两条:

  1. 名字要自解释:deploy-to-ecs 比 server-tool-1 好。模型看名字就能判断要不要用
  2. 一句话说明写清边界:不是"部署工具",是"将 Docker 容器部署到阿里云 ECS,支持端口映射和 Nginx 反代"

名字 + 一句话,100 Token。模型 90% 的场景看这些就够了。

省钱两条路:调参数 vs 换平台

到这里,省钱的思路其实就两条:

第一条:留在 OpenClaw,能调的就两样——

① 关心跳或拉长间隔

龙虾默认每 15 分钟跑一次心跳,一天 96 次,光这一项占掉 72% 账单。

在 OpenClaw 配置里把心跳间隔从 15 分钟改成 2 小时:

heartbeat:
interval:7200# 单位秒,默认 900(15分钟)

更狠的做法:不需要 24/7 监控的直接关掉。一个改动,月账单从 ¥1200 直接降到 ¥336。

② 换便宜模型

OpenClaw 默认用 Opus 跑所有任务,包括心跳。手动切成 DeepSeek V4 Flash,同样的活,成本差 250 倍:

模型
跑 1000 万 Token 的费用
DeepSeek V4 Flash
¥3.45
DeepSeek V4 Pro(2.5 折)
¥18.5
Claude Opus
¥100+
GPT-5.5 Pro
¥200+

但这两项只是止血。上下文膨胀、全量注入、技能全塞——这些 OpenClaw 的架构决定了,调参数改不了。


第二条:换 Hermes,架构层面直接省。

调参数 vs 换平台对比

OpenClaw 调不了的那些问题,Hermes 从设计上就解决了:

省钱能力
OpenClaw 能做吗
Hermes
关心跳
✅ 能调间隔
✅ 压根没心跳,空跑 = 0
换模型
✅ 能手动切
✅ 支持主模型 + 辅助模型分级
上下文压缩
❌ 不支持
✅ 自动压缩,长对话不滚雪球
记忆分层
❌ 全量注入
✅ 三层记忆 + FTS5 按需检索
技能渐进披露
❌ 启动全塞
✅ 三层加载,按需展开
语义去重
❌ 手动清理
✅ 内置 hermes memory dedupe
长期不膨胀
❌ 越用越贵
✅ SQLite 索引,数据库再大也只检索相关片段

换了 Hermes 之后,模型分级、压缩、分层记忆、渐进披露、去重——全是默认自带的,不用一项项调。配置文件长这样:

# ~/.hermes/config.yaml — 一次配好,省钱机制全开
model:
provider:deepseek
model:deepseek-v4-pro# 复杂推理用 Pro,输出 ¥6/M
base_url:https://api.deepseek.com/v1
api_key:${DEEPSEEK_API_KEY}

auxiliary:
default:
provider:deepseek
model:deepseek-v4-flash# 跑腿活用 Flash,输出 ¥2/M

compression:
enabled:true
threshold:0.50
target_ratio:0.20
summary_model:deepseek-v4-flash

算一笔总账

月费用三档对比
方案
Token 消耗/月
用 V4 Flash 的费用
用 Opus 的费用
OpenClaw 默认(啥都不改)
4000 万
¥80-120
¥1200
OpenClaw 调参(关心跳 + 换模型)
1100 万
¥25-40
¥336
Hermes(默认配置)800-1200 万¥15-25
—

留在 OpenClaw 调两项,能从 ¥1200 砍到 ¥336。但换 Hermes 一步到位 ¥15-25——架构自带的省钱机制比手动调参狠得多。


写在最后

Token 涨价是趋势,自助餐时代结束了。 如何让你的 agent 节省 token 

你现在每个月 Token 花多少?有没有被涨价劝退过?评论区聊聊。