快手KAT Coder登顶SWE-Bench,开源界最强“编程AI”出现了
最新消息,快手旗下AI团队 Kwaipilot 公布了自研模型 KAT-Dev-72B-Exp 的测试成绩—— 在严格的 SWE-agent 验证框架下,模型以 74.6% 的分数登顶 SWE-Bench Verified 榜单,成为目前开源模型中表现最强的代码修复智能体。
这意味着,快手的AI研究体系,第一次在国际标准化编程基准中,打败了包括 DeepSeek、Qwen-Coder、Claude Code 等一线选手。
一场从“短视频公司”打出来的AI战役
在国内的大模型赛道中,快手的角色一直有些微妙。 不像OpenAI、Anthropic那样纯粹以模型立身,快手更像是在业务驱动下的科研派——靠算法喂大了推荐系统,也靠算法喂出AI生态。
KAT系列就是这种基因的产物。
根据官方介绍,KAT-Dev-72B-Exp 是 KAT Coder 的强化学习实验版(RL preview)。 这套体系采用了 共享前缀轨迹(shared prefix trajectories) 和 熵约束奖励机制(entropy-shaped advantages) 来防止探索坍缩——这听起来有点抽象
让AI在写代码的时候,既敢试错,又不乱猜。
这正是过去所有AI编程模型的核心难题——“能写代码”和“能修Bug”之间,隔着的是理解力与耐心。
而KAT团队显然在这个问题上,迈出了一步。
一款由“四个智能体”协同的代码系统
值得注意的是,KAT Coder 并不仅仅是一个模型,而是一个多Agent协作体系。
它的架构包括:
🧑💻 Writing Agent:负责编写与生成核心代码;
🧪 Testing Agent:自动构建测试样例并发现潜在Bug;
🔧 Refactor Agent:负责代码性能优化与可维护性改进;
🚀 Deployment Agent:进行自动化部署和集成验证。
这种结构与 OpenAI 的 SWE-agent、Anthropic 的 Claude Code 体系类似,但KAT Coder在执行链条上更“工业化”—— 它并不只是一个研究Demo,而是已经在快手的部分内部开发流程中试运行。
业内人士指出,这意味着快手正尝试构建一个“自演化”的AI研发系统”: 开发团队用AI写代码,AI再优化AI的代码,循环加速。
SWE-Bench成绩的真正意义
对于AI编程模型来说,SWE-Bench Verified 是最具权威性的评估标准之一。 它考察模型能否在真实开源项目中,理解代码逻辑并修复缺陷。
74.6%的得分,意味着KAT Coder在近四分之三的真实Bug修复任务中,能给出正确、可运行的解决方案。
在这一点上,它不仅超越了DeepSeek Coder系列(71%)、Qwen-Coder(69%),甚至接近闭源巨头OpenAI的Codex 5系列水平。
而且这份成绩,是基于“严格脚手架”(strict SWE-agent scaffold)下测得的,也就是说,没有任何人工干预或搜索辅助。
开源背后的战略
更耐人寻味的是,KAT-Dev-72B-Exp 已经在 Hugging Face 上
开源地址:huggingface.co/Kwaipilot/KAT-Dev-72B-Exp
同时也能通过 StreamLake.ai 平台免费体验。
快手的这一步,很明显是在复制 DeepSeek 的成功路径——“开源+免费+高性能”三板斧,迅速拉拢开发者生态。
只不过,KAT Coder的定位更偏向于 面向生产级代码工程师的全流程工具,而非单纯的AI聊天助手。
在AI编程的世界里,速度很重要,但更重要的是稳定性和协作性。 KAT-Dev-72B-Exp 的出现,不只是快手的技术突破,也让外界重新思考一个问题:
当AI自己学会写、测、改、发—— 那么,“程序员”这个职业,还会是什么样?
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html