MacTalk

GPT-6 Astra 发布了,我却把 GPT 的订阅从 100 刀降到 20

这次降级与 Astra 的能力无关,完全是因为我开始大量使用 K3、Qwen 3.8 和 GLM5.3 了,又快又好还没有网络问题,Codex 100 刀根本用不完,都浪费了。

说回 Astra,今天只是发布,但大家都用不了。官方说法是:未来几天内向所有 Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 OpenAI API 和 AWS 使用。

按照 OpenAI 的介绍,它是目前能力最完整的模型,重点提升了计算机操作、浏览器使用、软件工程、研究和专业文档处理。支持 105 万 Token 上下文(多了个 5),最大输出 12.8 万 Token,还增加了两个很实用的 Agent 能力:

工具在后台运行时,模型可以继续推理或处理别的任务;用户也可以在任务进行中补充要求,模型调整方向后仍然记得最初的目标。

对 Coding Agent 来说,另一个变化更关键。过去长任务需要不断压缩上下文,每压缩一次,都可能丢掉一次失败原因或某个测试结果。Astra 在 Codex 里开始尝试跨上下文保留记忆,并搜索更早的对话与工具输出。一个跑几小时甚至几天的 Agent,可以有机会保持连续记忆,不用每隔一段时间重新认识自己的项目。

这是新的 Harness 尝试,如果可行,其他厂商肯定会跟进。

另外,Astra 是 OpenAI 第一个达到“关键级”网络安全能力的广泛部署模型,配合工具后,能自主发现未知漏洞。

看到这些变化,我依然认为 Astra 会是一款很重要的模型,也会继续使用 Codex。不过,它只是我的 Agent 之一。

过去一个季度,我主要用 K3 和 GLM 5.3 编程,让两个模型互相检查、互相 Review 代码,再让 GPT-5.6 Sol 审核方案。DeepSeek 继续通过 API 跑生产任务,Qwen 3.8 和 Qoder 也会进入新的组合。实际结果是,国产模型已经能够承担大部分高频开发工作,额度更充足,成本也低很多。最昂贵的模型留给架构判断、复杂审核和少数真正困难的任务,反而更符合工程常识。我的具体调整如下:

1、Codex 从 100 刀减到 20 刀,自从我主要用 K3 和 GLM 编程之后,真是量大管饱又聪明,Codex 这 100 刀基本都浪费了。留 20 刀做自动化任务和日常工作、review。

2、K3 和 GLM5.3 持续订阅,好用,如果 K3 不涨价的话,K3 是性价比最高的顶级模型。DeepSeek 还是用 API 的模式,在生产环境里跑很合适。墨问也是火山引擎企业级模型的用户。

3、 留 20 刀给到最新版的 Qoder,Qwen 3.8 系列基模发布之后,阿里大模型有种脱胎换骨的感觉,有些功能吸引到我,比如知识卡片和 Wiki。最近在用 Qoder 做 CatBar,预计今天发一版。Hy4 也定了一个月,试试看。

Image

模型差距依然存在,但已经没那么大了,在长任务稳定性、工具调用和边界处理上也有差异,但我可以通过自己的选择,让合适的 Agent 做合适的事情。

Coding Agent 最终要交付代码、文档和完成的任务,我的新方案是把 K3、GLM、DeepSeek 和 Qwen 放到主力位置,保留 20 美元的 Codex,用于自动化、日常 Review 和关键任务,也为 Astra 留一扇门。