我给阶跃星辰 Step 5 Preview 出了一道工程题
最近一段时间,我都在参与阶跃星辰的新旗舰模型小范围内测,我们测试的时候,模型代号还是 Water18。现在这款新旗舰有了正式的名字,叫 Step 5 Preview。先单独说明一下:我内测截图里的模型 ID water18-0910,代表的就是 Step 5 Preview。除了横评,文中提到的大部分测试结果都出自这个模型。
我肯定最关注模型的 Coding Agent 能力,所以拿到内测资格后,给它出了一道工程师经常会遇到的题:一个陌生的项目,一个能复现的 bug,一个顺手加上的小需求。为了测试它到底做得怎么样,我还拉来了另外两个小伙伴:阿里的 Qwen 3.8 Max 和月之暗面的 Kimi K3。三个模型拿到完全相同的任务包和提示词,在各自独立的目录和会话里开工,中途不许提问,我也不给任何提示。目录结构如下:
开始之前我们先认识一下这个新旗舰
6 月份我曾经介绍过 Step 3.7 Flash,当时印象就很深刻。这次的 Step 5 Preview 是阶跃星辰的新一代旗舰基模,开源,面向长程任务、Agent 和 Coding 领域。它的 Slogan 是:Advancing the Pareto Frontier——向前一步,智能效率的新一代“帕累托前沿”。就我自己的使用体感,就是把智能和成本的最优平衡点,再往前推进一步。
基模的基本规格:稀疏 MoE 架构,总参数 600B,每个 token 激活 27B,上下文窗口百万 tokens,支持视觉输入(图像、文本输入,文本输出),在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,在金融领域表现尤为突出。
API 定价是输入每百万 tokens 1 美元、输出 2.7 美元,缓存输入比标准输入便宜 95%。
下面我们看看这道题长什么样
任务包是一个叫 OrderHub 的订单管理小系统,Python 加 Flask,四百多行代码,带 SQLite 数据库和一套 pytest 测试。系统能运行但有个真实的 bug:在订单列表里筛选“已支付”,导出,拿到的 CSV 只有 20 条,里面还混着其他状态的订单——数据库里有真实的 80 条已支付订单。我还有一个需求:存储层偶尔写入失败,请加个重试,最多三次。
bug 稍微有点深,表面那层在路由里:导出接口压根没把筛选参数传给查询层。后面还跟着一个:就算把参数传进去了,查询方法默认只返回第一页的 20 条。
只解决第一个问题,导出 80 条已支付订单时会发现自己只拿到 20 条,测试用例是通不过的。重试那儿也有个机关:存储层对同一个文件名的第一次写入必然失败,没有重试逻辑,第一次导出必然遇到 500。
验收标准一共十项:测试全绿、筛选导出条数和状态全对、导出不受分页影响、首次写入失败自动重试、重试不留重复或残缺文件、列表筛选分页无回归、无筛选导出全量 235 条、组合筛选正确、存储持续失败时返回明确错误、API 契约不变。每项都对应一条 curl 命令或一个测试用例。
Step 5 Preview 交的卷
它用了 328 秒,28 次模型迭代,第一次宣告完成时,十项验收全部通过。零纠错,零澄清,零人工介入。这个成绩相当不错。
它没有在最省事的调用处打补丁,而是在数据访问层新增了一个专门的 query_all 方法,语义上把“不分页、取全部”说清楚,导出走新方法,列表的分页逻辑原样保留。分层边界是这类问题最容易被糊弄过去的地方,它处理得干净。
另一个细节是测试。它主动给项目补了两个测试用例,其中一个模拟存储彻底挂掉,验证重试耗尽之后不仅返回 500,而且导出目录里非常干净,临时文件全部清除。这条断言对应的是我验收清单里的第九项。
唯一的问题是存储持续失败时,它只返回了一个错误信息“export failed”,虽然够用,但运维显然更喜欢写着重试次数和底层原因的报错。
再看看 Qwen 3.8 Max 和 Kimi K3 怎么说
Qwen 3.8 Max 最快,206 秒,18 次迭代,同样十项全过。它只改了一个文件:路由层先查总数,再按总数一次性取回,绕开分页。务实有效,但查询层那个“默认只给 20 条”的行为给保留了,其他人可能会踩坑。补测试补得最勤,四个用例,覆盖关键词筛选、全量导出和非法参数;失败报错也写得最详细,带重试次数和原始原因。
Kimi K3 用时也在 320 秒左右,十项全过,解法和 Qwen 基本一致,重试封装得更讲究一些,错误信息里带上了底层原因。
测试环境是 macOS 加 Kimi Code 和 Qoder,三家使用完全相同的提示词、代码包和验收清单。
我的判断:这是个好模型啊
这是个带两层 bug、一个隐藏故障点、十项硬性验收的工程任务,放在去年足以难倒绝大多数模型,现在三家都能一次通过,而且都懂得补测试、不碰我设计的断言、保持 API 契约,非常厉害。
Step 5 Preview 让我记住的是它的工程品味:它是唯一一个把 fix 放回了原来位置的选手。快一分钟慢两分钟,对真实工程来说没那么重要;但留在查询层里的分页默认值,在现实的工程里总会坑下一个人。
看模型发布报告,它的单任务成本是 GLM-5.3 和 Kimi K3 的 35%、Claude Opus 5 的 12.5%,这个还是很惊艳的。如果同等智能水平的价格真的打到三分之一,很多团队算得过来的账就得重算了。这大概也是“帕累托前沿”这句口号的味道,智能和成本并重。
趁着无限 Token,我来干点实事
除了这道标准化的工程题,趁着无限 Token,我赶紧用来做点真实项目。
第一个项目:上周有个用户分享了他自己的开源项目,叫 Agent Hud,官网是 https://agenthud.app,可以利用 macOS 的灵动岛非常优雅地展示你的 Agent 使用额度,比如这样:
不过这个产品有个问题,就是刘海屏的 MacBook 接了外屏之后,它还会给你的大外屏上强制画一个刘海,还有个问题:不知道为什么,下拉菜单里没有退出选项,用着很不方便。既然是开源,那咱们就自己动手,丰衣足食。
我直接 Clone 了这个项目,让 Step 5 Preview 按照我的理解开始修改:
几轮交互之后,在非刘海的外屏上,它会只显示菜单项加退出,只在笔记本显示屏上才会有灵动岛的交互,这个任务完成得又快又漂亮。
第二个项目,是墨问的 CatReader。我之前做了一次产品计划,为用户提供更主动的阅读 Agent,第一步是提供主题阅读任务,当用户在 AskCat 里选中主题阅读卡之后,说“我想研究一下最近 Agent 产品的进展”,CatReader 会弹出一个任务卡,帮助你选择合适的文章进行主题阅读,期间可以批量收藏文章,做深度研究,并保存成墨问笔记等等。
这个项目我选择了让 Codex + Astra 和 CC + Step 5 Preview 交叉设计、实现和 review,整体效果相当不错,比如 Step 5 Preview 会对 Astra 的实现给出自己的看法:
Astra 的反馈如下,并且根据 Step 5 Preview 的部分意见进行了修复:
周末搞了两天,两个高手配合,Step 5 Preview 主实现,Astra 主审核,这个功能我已经发到测试环境了:
用户点击确认开始任务,AskCat 就会帮你筛选文章,加收藏,做研究,还能直接把研究成果保存到墨问里:
目前这个功能还有些小 bug,预计本周再修修就可以上线了。这个阅读 Agent,是我这次基模内测的一个附加收获,乌拉。另外,模型测试过程里我遇到的一些中断,安全护栏提示不合理等问题,都直接反馈给模型厂商,很快得到了处理和修复,非常开心。
最后看看权威榜单的数据
今天阶跃星辰的这款旗舰模型已经正式发布了,我们看看官方榜单的数据,比我专业:
Coding 方向上,DeepSWE v1.1 拿到 67.7%,与 Kimi K3 的 67.5%、GLM-5.3 的 66.9% 相近;自研的 StepCodeBench(覆盖 553 个真实代码仓库、33 种编程语言)拿到 49.0%。
长程任务:在一张 H100 上连续 24 小时从零优化 MLA GPU Kernel,最终跑到 508 TFLOPS;还有个彩蛋,它在没有任何专项优化的情况下连续玩 Pokémon Red 超过 3000 回合,累计交互近 600 万 tokens。金融方向的外部评测 FrontierFinance 上拿到 66.4,仅次于 Claude Opus 5。另外值得一提:这款模型将于 10 月 15 日正式开源。
官网放出的部分评测结果:DeepSWE、StepCodeBench、ProgramBench 等
第三方机构 Artificial Analysis 的榜单上,它的 Intelligence Index 是 44(v4.3 口径),单任务成本 0.71 美元。同等智能水平下,它的单任务成本是 GLM-5.3 和 Kimi K3 的 35%,Claude Opus 5 的 12.5%。一句话概括定位:用明显更低的价格,提供 Frontier 级别的能力。
Step 5 Preview 官方“帕累托前沿”图:横轴为单任务成本(对数刻度),纵轴为 AA 智能指数,Step 5 Preview 以约三分之一成本站上新前沿
Artificial Analysis 榜单:智能 44 分、每任务成本 0.71 美元,右侧成本对比里优势很直观
这次内测,除了完成那道工程题,Step 5 Preview 还帮我改好了一个日常使用的工具,把 CatReader 的新功能推进到了测试环节。这样的收获,比跑分和榜单有价值得多。
如果更强的模型能以更低的成本进入日常开发,我们就能把更多时间花在那些一直想做、还没做完的事情上。比如我这个阅读 Agent,再修几个 bug,就能和大家见面了 :)