Cursor 被抓包:价值 300 亿美元的 AI 编程工具,底层悄悄用了中国模型
鹿Sir上线,见字如面。
最近,一个叫 Fynn 的开发者做了一件很简单的事:在本地搭了个调试代理,把 Cursor 的 API 流量过了一遍。结果他在请求里看到了一个模型 ID——accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast。
他在 X 上发了一句话:"So composer 2 is just Kimi K2.5 with RL。At least rename the model ID。"
这条帖子获得了 260 万次浏览。
Cursor,这家估值 293 亿美元的 AI 编程工具公司,刚刚发布了 Composer 2,对外宣称是"前沿级编程智能",是公司作为真正 AI 研究实验室的证明。但发布博客里,没有提到 Kimi,没有提到 Moonshot AI,没有提到任何中国公司。
几小时后,Cursor 的开发者教育副总裁 Lee Robinson 确认了 Kimi 的存在。联合创始人 Aman Sanger 承认,一开始没有披露基础模型是个失误。
事情就这样曝光了。
Kimi K2.5 是什么来头
Kimi K2.5 是月之暗面(Moonshot AI)发布的开源模型,背后站着阿里巴巴、腾讯和红杉中国(HongShan)。
参数规模:1 万亿参数的混合专家架构(MoE),每次推理激活 320 亿参数,上下文窗口 256,000 tokens,原生支持图像和视频,还有一个叫 Agent Swarm 的能力——可以同时运行最多 100 个并行子智能体。
在 MathVista 基准测试上,Kimi K2.5 发布时排名全球第一。
它采用修改版 MIT 许可证,允许商业使用。
Cursor 不是随便找了个模型凑数。他们选 Kimi K2.5,是因为它在 Agent 稳定性和长任务处理上有明确优势——而这正是 Composer 2 最核心的能力需求。
Cursor 到底做了什么
Cursor 并不是简单地套了个壳。
Lee Robinson 说,Composer 2 总训练计算量里,约 四分之一来自 Kimi 基础模型,四分之三是 Cursor 自己的继续训练。
他们开发了一项叫做自我摘要(Self-Summarization)的技术:当 AI 编程 Agent 处理复杂的多步骤任务时,上下文会不断膨胀,超出模型的记忆上限。传统做法是截断旧上下文或用另一个模型来总结,但这会导致关键信息丢失,引发连锁错误。
Cursor 的方案是:让模型在强化学习过程中,学会在任务中途压缩自己的工作记忆。当 Composer 2 接近上下文上限时,它会暂停,把所有内容压缩到约 1,000 个 token,然后继续。这些摘要会根据是否帮助完成整体任务来获得奖励或惩罚,模型因此学会了什么该留、什么该丢。
效果:与基于提示词的基线方案相比,自我摘要将压缩错误降低了 **50%**,同时只用了 五分之一的 token。
作为演示,Composer 2 解决了一个 Terminal-Bench 问题——把原版《毁灭战士》(Doom)编译到 MIPS 处理器架构上——用了 170 轮对话,期间反复对超过 10 万个 token 进行自我摘要。多个前沿模型无法完成这个任务。
在 CursorBench 上,Composer 2 得分 61.3,而 Composer 1.5 是 44.2;Terminal-Bench 2.0 上得分 61.7,SWE-bench Multilingual 上得分 73.7。
为什么西方公司要用中国模型
这才是这件事真正值得深想的地方。
Cursor 选择 Kimi K2.5,不是因为没有其他选择,而是因为西方开源模型在这个需求上确实不够用。
Meta 的 Llama 4:Scout 和 Maverick 在 2025 年 4 月发布,但表现令人失望。更受期待的 Llama 4 Behemoth(2 万亿参数)至今没有发布日期,据报道 Meta 内部团队也不确信它的性能提升足以支撑发布。
Google 的 Gemma 3:最大只有 270 亿参数,适合边缘部署,但不是构建生产级编程 Agent 的前沿基础。
OpenAI 的 gpt-oss:2025 年 8 月发布了 200 亿和 1200 亿参数版本。但问题在于,gpt-oss-120b 是稀疏 MoE 架构,每个 token 只激活 51 亿参数。对于通用推理助手,这是效率上的杰作;但对于需要在 256,000 token 上下文窗口中保持结构连贯性的 Composer 2 来说,这个"厚度"不够。
Kimi K2.5 每次激活 320 亿参数,是 gpt-oss 的 6 倍。在 Agent 编程这个高强度场景里,认知密度仍然决定性能。
此外,OpenAI 的开源模型在开发者圈子里有个悄悄流传的评价:**"后训练脆弱"**——开箱即用很出色,但在高强度强化学习下容易出现灾难性遗忘。Cursor 对 Kimi K2.5 进行了 4 倍计算量的规模化训练,Kimi 专为 Agent 稳定性设计的架构提供了更耐用的"底盘"。
结论很清晰:中国实验室——月之暗面、DeepSeek、Qwen——正在填补西方开源模型留下的空白。DeepSeek V3 和 R1 在 2025 年初以极低成本匹配了前沿性能,引发硅谷震动。阿里的 Qwen3.5 系列覆盖了从 6 亿到 3970 亿激活参数的几乎每个规模档位。
Cursor 不是唯一一家面临这种选择的公司。任何需要在开源模型上构建专业 AI 应用的企业,都面临同样的算盘:最强、许可最宽松的开源基础模型,不成比例地来自中国实验室。
这件事的真正问题
Cursor 联合创始人 Aman Sanger 承认,没有在发布博客里提到 Kimi 是个失误。原因不难推断:
Cursor 以接近 300 亿美元的估值融资,前提是它是一家 AI 研究公司,而不是别人模型的集成层。而 Kimi K2.5 来自一家由阿里巴巴支持的中国公司——在美中 AI 关系紧张、政府和企业客户越来越关注供应链来源的当下,这个出身很敏感。
但 Moonshot AI 在事件曝光后的回应是支持性的:他们在 X 上表示,很自豪看到 Kimi 提供了基础,并确认 Cursor 通过 Fireworks AI(一家模型托管公司)获得了授权商业合作。没有任何东西被盗用,使用是合法授权的。
真正的问题不是 Cursor 用了 Kimi,而是整个行业的激励结构鼓励隐瞒这种连接——尤其是当基础来自中国时。
OpenAI 的模型训练在数十年学术研究和互联网规模数据之上。Meta 的 Llama 训练数据并不总是完全透明。每个模型都站在前人工作的肩膀上。问题是公司怎么说——而现在,沉默比透明更有利可图。
对于正在评估 AI 编程工具的企业 IT 决策者,这个事件提出了几个实际问题:你知道你的 AI 供应商产品底层是什么吗?这对你的合规、安全和供应链要求重要吗?你的供应商是否履行了其基础模型的许可义务?
西方开源的差距正在缩小,但很慢
好消息是,西方开源模型正在追赶。
NVIDIA 最近动作频繁:3 月 11 日发布的 Nemotron 3 Super 是 1200 亿参数的混合 Mamba-Transformer 模型,120 亿激活参数,100 万 token 上下文窗口,吞吐量比前代提升最高 5 倍。Perplexity、CodeRabbit、Factory 等公司已经在接入。
几天后,NVIDIA 又发布了 Nemotron-Cascade 2——300 亿参数 MoE 模型,仅 30 亿激活参数,在数学、代码推理、对齐和指令跟随基准上超越了 Qwen 3.5-35B 和更大的 Nemotron 3 Super,并在 2025 年国际数学奥林匹克竞赛上达到金牌级别表现。
差距在缩小。但在它真正弥合之前,Cursor 这样的公司还会继续做同样的选择——只是下次,他们可能会在博客里写清楚。
EOF
分享架构技术/IT资讯/牛马日常
电商·SaaS·AI架构师,DDD极客/DDD4j开源框架作者
→关注公众号,撩小码鹿「已接入AI」
→加我备注“进群”,进技术大佬群学习