Token 全面涨价,我养不起小龙虾了,让我来让 Token 账单砍 72%
说句"你好",7300 Token 没了。 我发现我订阅的 腾讯云 coding plan,被替换成了 token plan,然后提示我余额不足!揪心,再这样我要养不起小龙虾了。
有人算过账:一个月 4000 万 Token,账单 ¥1200。拆开一看,72% 花在心跳上。你在睡觉,它在花钱。
龙虾贵在哪?有没有更省的方案?
无限自助餐没了
Coding Plan 集体退场。阿里百炼 Lite 上线 23 天停售,腾讯云 Coding Plan 直接转 Token Plan,智谱两个月内涨价 30% + 砍额度 + 停老套餐。国外也一样——GitHub 暂停 Copilot 新注册,Cursor 上线 $200 Ultra 档,GitHub 官宣 6 月起全面转 Token 计费。
Token 变成硬通货了。 谁能省 Token 谁就有优势。
全场涨价的时候,DeepSeek 反向降价。V4 系列定价:
| V4 Flash | ¥0.02/M | |||
| V4 Pro | ¥0.025/M |
对比 GPT-5.5 Pro 输出 0.28/M——千分之一点五。发布 48 小时内又连砍两刀,2.5 折优惠延长到 5 月底。
这个价格差是后面所有省钱方案的基础。
四个吞金黑洞
入场费:系统提示词的固定开销
每次调用 OpenClaw,不管你问什么,AGENTS.md、SOUL.md、各种规则和工具描述先塞一遍。合计 7300 Token。
你问它"今天天气怎么样",它也得先把这堆东西读完再回你。一天调 60 次,光入场费 43.8 万 Token。一个月仅这一项 ¥140。
心跳:最大元凶,占 72%
OpenClaw 有个心跳机制——你没在用,它每 15 分钟自己跑一次。
每天 96 次 × 约 10,000 Token/次 = 96 万 Token/天。
一个月:2880 万 Token,占总消耗 72%。
你上班 8 小时用它干活,另外 16 小时它自己空转烧钱。什么都不干,一天 ¥145 没了。
36 氪那篇文章标题写得直白:月薪两万都养不起龙虾。我反正养不起。
上下文膨胀:滚雪球
OpenClaw 的记忆机制是把对话历史往上下文里塞。用得越久,上下文越长,每次调用越贵。
第 1 天,一个问题消耗约 2000 Token。第 30 天,同样的问题,45,000 Token。
22 倍。干的活一模一样,花的钱天差地别。
大炮打蚊子:模型不分级
心跳检查、简单状态查询、格式化输出——这些"跑腿活"也拉顶配模型来干。
用 Claude Opus 跑心跳 vs 用 DeepSeek V4 Flash 跑心跳,成本差 15 倍。
但龙虾默认不区分。所有任务一个模型一个价,心跳也用 Opus。这钱花得属实冤枉。
Harness 的思路
有个公式:Agent = Model + Harness。
Model 是大模型。Harness 是模型之外的所有东西——提示词怎么组织、记忆怎么管、技能怎么加载、上下文怎么控制。
Vivek Trivedy 说过:大多数人盯着 Model 省钱(换便宜模型、砍推理次数),但真正该动刀的是 Harness 那一层。
Token 爆炸的三类根因:
水龙头没关严,一天漏一滴,觉得没什么。月底看水费账单——地板泡了一个月了。
分层记忆:记住该记的,扔掉该扔的
龙虾:每次对话把所有历史塞进上下文。越用越长,越长越贵。
Hermes Agent:三层记忆分离,按需加载。
deployment-checklist.md |
新对话开始,Hermes 不把过去所有历史塞进去。它根据你当前说的话,去 SQLite 里做全文检索,只拉相关的几条。
积累几个月对话,也不会变慢或变贵。
数据:分层记忆 + 动态加载,Token 消耗降低 40-60%。道理也简单——你不会每天出门把全部家当背上吧,带今天用得到的就够了。
Skill 文件 = 压缩后的经验
你跟 Agent 聊了十次怎么部署项目,踩了各种坑。龙虾每次把这十次对话全塞进上下文。
Hermes 不一样:十次对话的教训压缩成一个几十行的 markdown 文件(Skill),下次遇到类似问题只加载这个文件。
十次对话 5 万 Token。一个 Skill 文件?几百 Token。
龙虾是每次把整本笔记本翻一遍,Hermes 是翻目录找那一页。
渐进披露:技能别一股脑全塞
记忆之外,技能加载也是个大头。
很多 Agent 框架启动时把所有工具的完整描述全塞进系统提示词。工具越多,提示词越长,每次调用固定开销越大。
Hermes 用了一个叫"渐进披露"的机制,分三层加载:
启动时只加载 Level 1。模型判断需要哪个工具,再展开那个的 Level 2。真正执行了才加载 Level 3。
从平均 15,000 Token/次 降到 3,000-5,000 Token/次,省了 66-80%。
怎么写技能描述才省 Token?两条:
名字要自解释: deploy-to-ecs比server-tool-1好。模型看名字就能判断要不要用一句话说明写清边界:不是"部署工具",是"将 Docker 容器部署到阿里云 ECS,支持端口映射和 Nginx 反代"
名字 + 一句话,100 Token。模型 90% 的场景看这些就够了。
省钱两条路:调参数 vs 换平台
到这里,省钱的思路其实就两条:
第一条:留在 OpenClaw,能调的就两样——
① 关心跳或拉长间隔
龙虾默认每 15 分钟跑一次心跳,一天 96 次,光这一项占掉 72% 账单。
在 OpenClaw 配置里把心跳间隔从 15 分钟改成 2 小时:
heartbeat:
interval:7200# 单位秒,默认 900(15分钟)
更狠的做法:不需要 24/7 监控的直接关掉。一个改动,月账单从 ¥1200 直接降到 ¥336。
② 换便宜模型
OpenClaw 默认用 Opus 跑所有任务,包括心跳。手动切成 DeepSeek V4 Flash,同样的活,成本差 250 倍:
| ¥3.45 | |
| ¥18.5 | |
| ¥100+ | |
| ¥200+ |
但这两项只是止血。上下文膨胀、全量注入、技能全塞——这些 OpenClaw 的架构决定了,调参数改不了。
第二条:换 Hermes,架构层面直接省。
OpenClaw 调不了的那些问题,Hermes 从设计上就解决了:
hermes memory dedupe | ||
换了 Hermes 之后,模型分级、压缩、分层记忆、渐进披露、去重——全是默认自带的,不用一项项调。配置文件长这样:
# ~/.hermes/config.yaml — 一次配好,省钱机制全开
model:
provider:deepseek
model:deepseek-v4-pro# 复杂推理用 Pro,输出 ¥6/M
base_url:https://api.deepseek.com/v1
api_key:${DEEPSEEK_API_KEY}
auxiliary:
default:
provider:deepseek
model:deepseek-v4-flash# 跑腿活用 Flash,输出 ¥2/M
compression:
enabled:true
threshold:0.50
target_ratio:0.20
summary_model:deepseek-v4-flash
算一笔总账
| ¥1200 | |||
| Hermes(默认配置) | 800-1200 万 | ¥15-25 |
留在 OpenClaw 调两项,能从 ¥1200 砍到 ¥336。但换 Hermes 一步到位 ¥15-25——架构自带的省钱机制比手动调参狠得多。
写在最后
Token 涨价是趋势,自助餐时代结束了。 如何让你的 agent 节省 token
你现在每个月 Token 花多少?有没有被涨价劝退过?评论区聊聊。