我的 K3“阵亡”了,降价的 GPT-6 Sol 来救场
昨天我的 K3 额度已经打光了,周重置得到周五下午。还好,天降奇兵,GPT-6 Sol 来救场了,还是降价来的。
最近在集中做一些产品功能,K3 蹬得比较猛,Codex 里的 Astra 用来 review K3 的实现,并做一些交叉验证,这样混搭着开发,能省着用 Astra,另外就是代码质量和功能覆盖度好了很多,减少了我测试的工作量。
周三跑了一个长任务,终于把 K3 的周额度干到了 100%,后续如果用 Astra 直接整大功能,恐怕 Codex 阵亡也是指日可待。
咋办,没有 AI 和 Agent 的日子,我们怎么过?
还好,OpenAI 在 9 月 22 日推出了 GPT-6 Sol 和 Luna。都是 6 系列,Astra 负责最困难的任务,Sol 面向复杂编程和 Agent,Luna 面向范围明确、简单、调用量大的任务。GPT-6 这个系列,开始有了更清楚的分工,Sol 这一档的价格也降下来了。
在标准 API 计费、输入不超过 272K token 的条件下,每百万输入和输出 token,Sol 分别收 2 美元和 10 美元,Luna 分别收 0.10 美元和 0.50 美元。Sol 的这两项单价,比上一代 GPT-5.6 Sol 的促销价低了 50%,也相当于 Astra 对应单价的五分之一。
API 单价和订阅额度怎么对应,我目前还没摸清。但蹬了一阵子 GPT-6 Sol,感觉能力够用,额度消耗也能接受。目前 Codex 已用了约 60% 的周额度,重置还有 2 天,很宽裕,毕竟 K3 一天后就重新上线了。
这件事也让我反思了一下自己的工作流,如何分配不同模型的用量?额度充足的时候,很容易形成惯性,打开常用工具,同一个模型,撒开了整。等额度见底才想起来,这活儿,K2.8 preview 好像也行啊。
以前这种 Coding Plan 真是抗用,旗舰模型敞开了蹬根本用不完,现在是王小二过年,一年不如一年了。地主家也没有余粮了,还是得优化自己的工作流。
我最近开始把工作分成三类。
第一类,需求清晰,也好验收的——按明确要求提取文章要点、改文案、整理文件、按固定步骤更新软件等等——通常可以先让 Luna 或 K2.8 这样的低成本模型处理。
第二类,日常研发任务,需要理解上下文,也需要持续推进——做功能、修改功能、定位有明确线索的 bug、技术产品预研等——适合用 Sol 或 K3 这样的模型作为日常主力。这里需要注意的是,你得自己定好验收标准,功能性测试,关键点核实,确认事实信源,做完了自己再走一遍更踏实。
第三类,有些功能不知道该怎么做,需要进行产品方向的探讨,高难度 bug 的修复——比如和 AI 讨论产品迭代的方向,系统为什么反复出错,这几种架构该怎么取舍,这时我更愿意直接使用 Astra 这样的强模型。方向和决策性的东西错了,后面烧的 Token 全是浪费。
另外就是研发任务让强模型之间相互做 reivew,会大大提高代码质量。
所以呢,选用模型不能一味从最便宜的开始。难以定位的并发问题,让便宜模型来回猜十轮,可能比强模型一次找到关键线索更贵。直接用强模型,还可能省下不少时间。
反过来,也不要什么都用强模型,我给自己的墨问笔记自动打标签,每次都调用旗舰模型就毫无意义了。
目前看,一个任务的成本至少包含这三部分:Token 消耗、等待时间、人工返工。还有些错误很晚才暴露,修起来更麻烦。所谓性价比,首先得有性能,然后才算价格。
另外,当模型连续两次都没有搞定同一个问题的时候,我会重新梳理 prompt,并换一个模型来解决,大概率管事。每次做项目做产品,一定让模型把文档都写好:功能、目标、约束、已经试过的方法、失败结果和当前文件状态等等,这样切换模型的时候,关键上下文就能接续上,不用每次重新交代一遍。
马上放假,墨问的 CatReader 今天上线了主题阅读功能(AskCat 里有个主题阅读卡),你想阅读和研究点啥,告诉 CatReader,帮你做任务卡,写研究报告,还可以随时把模型的输出保存到墨问里。另外,CarReader 的 阅读 Agent 已经开放了外网权限,可以随时联网查询做阅读任务了。
CatReader 的含金量还在增加,墨问会员直接用就行了,非会员可以点击阅读原文,领取 CatReader 和墨问会员体验卡,100 个先到先得。
祝大家中秋快乐 🌹