100亿token实测18个模型,仅一家能长期维护
中山大学与阿里联合发布的 SWE-CI 报告,给正处于 AI 编程狂热中的我们泼了一盆冷水。这是首个关注持续集成循环(CI loop)的代码维护 Benchmark。
【核心数据揭晓】
Claude Opus 断层领先:但在长周期的代码演进中,最强模型的零回归率也仅过半(50%+)。
“快照式”神话破灭:绝大多数模型在面对跨越 200+ 天、多次 commit 的真实任务时,会迅速堆积技术债。
【为什么这支撑了我对 SDD 的判断?】
我最近一直对 Spec 驱动开发(SDD)持保留意见。SDD 布道者认为 Spec 是大型系统的唯一入口,但如果 AI 无法可靠地解决回归问题,所谓的 Spec 就会与实际代码产生脱节。
2026 年,AI 能写代码,但远不能可靠地“养”代码。
真实开发中,维护成本占比高达 80%。目前的 AI Agent 往往在短跑(SWE-bench)中表现惊艳,但在长跑(SWE-CI)中,如何利用“架构师+程序员”的双 Agent 体系守住可维护性(EvoScore),才是接下来的技术深水区。
👇 评论区聊聊:你敢把存量核心系统的维护交给 AI 吗,也就是长期全自动或者接近自动的 agent loop 式迭代?
📌 关注 + 转发给你的技术群
🔗 论文:arXiv 2603.03823
🔗 数据集:github.com/SKYLENAGE-AI/SWE-CI