两个月迭代一次,DeepSeek 不再「慢」了
V4 发布的时候,大家叫它中国 AI 的「技术招牌」。两个月后,V4.1 已经进灰度了。代码能力强到有人用了四个字:「天差地别」。一家公司从单次迭代 144 天,变成两个月迭代一次——这事儿比模型本身有意思。
2025 年 1 月 R1 发布到 2026 年 4 月 V4 发布,整整 16 个月里,DeepSeek 最近的两次模型间隔——V3.2 到 V4——足足 144 天。
在全球大模型公司平均每两周迭代一次、半年发布约 50 个模型的节奏下,DeepSeek 的「慢」成了一种风格。业界理解它:量化基金养出来的实验室,不靠融资活着,慢工出细活。
V4 发布那天,这种叙事达到了顶峰。1.6T 参数的 MoE 架构、1M 上下文窗口、90% KV Cache 压缩——技术指标确实漂亮。
但很多人漏掉了一个细节:V4 被标为「Preview」。不是正式版。
DeepSeek 上一次用「Preview」标签,是 V3 系列。从 V3 Preview 到 V3.1,花了差不多半年。
这次不一样。V4 Preview 到 V4.1,用了不到两个月。
● ● ●
「天差地别」——灰度测试泄露了什么
6 月 15 日,Linux.do 社区网友 @风云雨 发帖:DeepSeek 网页端疑似上线了 V4.1 Flash 模型。
他观察到两个变化。一是知识截止日期从 2025 年 5 月跳到了 2026 年 1 月(有人甚至测到了 5 月)。二是代码生成能力——他用的是金门大桥 three.js 场景测试。
他的原话是:「天差地别」。
同一个测试,V4 Flash 只能生成基础版本,V4.1 Flash 一次性生成了完整的三维场景——桥梁结构、水面反射、光照效果全部到位。鸬鹚 SVG 测试也明显更好。
这些不像是修修补补的微调能做到的。博客园上九章智算云的分析认为,V4.1 的代码飞跃来自基模型本身的变化——不是 SFT 和 RLHF 在表面抛光,而是预训练阶段就埋下的架构红利。
问题来了:DeepSeek 在 V4 Preview 后的这两个月,到底做了什么?
● ● ●
为什么代码能力会「天差地别」
答案藏在去年 12 月的一篇论文里。
2025 年 12 月 31 日,DeepSeek 团队发布了 mHC(Manifold-Constrained Hyper-Connections) 论文。这项技术的核心思路是改造 Transformer 的残差连接——不是让它自由流动,而是约束在一个双随机矩阵(Birkhoff Polytope)的流形上。
简单说:信号永远不会爆炸。
训练一个 1.6 万亿参数的 MoE 模型,最大的敌人是梯度崩塌。层数越深,信号越弱,模型越难从训练数据中提取有效模式。mHC 通过 Sinkhorn-Knopp 算法强制每一层的残差信号保持守恒——这在实验阶段只在 27B 的小模型上验证过,现在跑在了 V4 的旗舰架构上。
另一个关键变化是 混合注意力(CSA + HCA)。
传统 Transformer 的 KV Cache 在 1M 上下文下需要 GB 级的显存。DeepSeek 的做法是把注意力拆成两种:
- CSA(Compressed Sparse Attention):每 4 个 token 压缩成一条 KV 记录,再用「闪电索引器」挑出最相关的块做稀疏注意力——相当于只翻档案柜里的关键卡片
- HCA(Heavily Compressed Attention):每 128 个 token 压缩成一条,直接做稠密注意力——因为压缩后序列很短,全量算也够便宜
结果:V4 Pro 在 1M 上下文下的 KV Cache 只有 V3.2 的 10%,推理 FLOPs 只有 27%。
但对代码生成来说,mHC 比 HCA/CSA 更重要。代码生成最怕的是「写到一半崩了」——函数体不一致、变量名串位、逻辑断裂。mHC 的稳定信号传播直接减少了这种深层不一致,V4.1 Flash 能在一次生成中完整写完复杂的 three.js 场景,就是这个道理。
● ● ●
从 144 天到两个月:节奏为什么变了
V4 是 4 月 24 日发的。V4.1 灰度测试 6 月 15 日上线。满打满算,不到 60 天。
技术能力没变,变的是组织。
DeepSeek 在 6 月初完成了 500 亿人民币的外部融资。这笔钱的背景,我上一篇文章分析过:腾讯领投、大基金跟投、中东主权基金参股,外部投资人没有投票权。
但钱不是重点。重点是人。
融资前,DeepSeek 不到 200 人。V3.2 到 V4 的 144 天空窗期,有一部分原因就是人才流失——DeepSeek 的技术光环反而把核心研究员推到了聚光灯下,对手挖人不需要太多介绍。
融资后,梁文锋拿到了期权池和薪酬包。V4.1 的节奏说明了一件事:DeepSeek 终于能留人了。
而且不止是留人。从 V4 Preview 到 V4.1 的两个月时间线,能反推出一个结论:V4 发布时,V4.1 的后训练已经在跑了。 DeepSeek 在用 Preview 标签给自己留余地——先发版本占坑,再灰度测试收反馈,最后正式版补全。
这是一种典型的「快公司」打法。之前只有 OpenAI 和 Anthropic 这么玩。
● ● ●
6 月窗口:AI 史上最拥挤的发布月
DeepSeek V4.1 不是孤例。看看 6 月的排期:
| 公司 | 模型/事件 | 时间 | 状态 |
|---|---|---|---|
| **DeepSeek** | V4.1 Flash 灰度 | 6/15 | 灰度中 |
| **OpenAI** | GPT-5.6 | 6/23(传闻) | 未确认 |
| **Moonshot AI** | Kimi K3 | 6/30(Polymarket 59%) | 未发布 |
| **Alibaba** | Qwen 3.7 Plus | 6/1 | 已开源 |
| **Microsoft** | MAI-1 | 6/2 | 私有预览 |
| **NVIDIA** | Nemotron-3-Ultra | 6 月初 | 已发布 |
一个月内,中美六家头部实验室同时出牌。这不是巧合。
2026 年的模型竞争早就不是「谁参数多」或者「谁价格低」了。真正的战场是 Agent 时代的 API 份额——Codex、Claude Code、Cursor 这些 Agent 工具把开发者变成了 API 高频用户,谁先占住这个入口,谁就拿走了下一阶段的增长杠杆。
这也是 V4.1 死磕代码的原因。讨好的不是普通用户——是 Agent 开发者。一个能稳定生成复杂 three.js 场景的模型,在 Agent 循环里的工具调用质量和多步推理精度也会更高。
● ● ●
V4.1 的局限:多模态还在路上
灰度测试暴露了一个明显的缺口:V4.1 Flash 没有多模态能力。
V4 发布时,多模态被当做一个重要卖点——6 月初 DeepSeek 在网页端上线了识图模式,API 文档里也写了视觉能力的基准测试。但灰度测试显示,V4.1 Flash 在图像理解上没有任何可观测的进步。有人测试让模型分析截图里的 UI 布局,结果和 V4 没区别。
博客园的九章智算云分析认为,多模态是推理成本的黑洞。DeepSeek 的 API 定价是所有头部模型里最低的(V4 Flash 输出 $0.28/M tokens,GPT-5.5 的 1/100),一旦开放图像输入,推理开销可能翻几倍——价格体系会被直接击穿。
所以 V4.1 的策略很可能是「先搞定代码,多模态缓一缓」。这和 V4 Preview 只发 Flash 版本的思路一脉相承:用最小的变体做灰度测试、收真实世界反馈,大版本等准备好了再上。
● ● ●
慢公司的「快」转型
V4.1 最值得说的,不是代码能力强了多少。是 DeepSeek 变快了。
两个月迭代一次、Preview 灰度策略、Flash 先跑 Pro 后补——以前只有 OpenAI 和 Anthropic 这么玩。DeepSeek 学过来,而且学得不慢。
500 亿融资到手后,这家不到 200 人的公司正在从「实验室文化」向「平台型组织」转型。V4.1 是第一块试金石。
如果 V4.1 的正式版能兑现灰度测试中「天差地别」的代码能力,而且价格不变——那 DeepSeek 就不是在追 GPT 了。它是在重新定义「便宜」这个词在 Agent 时代的上限。
V4 让 DeepSeek 证明了自己能做顶级模型。V4.1 要证明的是——它能做顶级模型的 迭代。