融资、造芯、面试——DeepSeek 最近新闻有点密
过去一周,DeepSeek 的动态有点密集。
6 月底完成首轮融资,估值超 500 亿美元。V4 正式版搞了峰谷定价,高峰期价格翻倍。7 月初,路透社曝出正在自研 AI 芯片。中间还夹了场面试风波——前华为天才少年李博杰公开吐槽面试体验,然后投资人又跳出来反怼。
先说芯片这条最大的。
路透社的消息源是三位知情人士。
先说事实。DeepSeek 做的不是训练芯片,是推理芯片——就是模型训完之后,用来跑推理、生成回答的那种。项目大约一年前启动,还在早期。他们已经接触了芯片设计公司、晶圆代工厂和存储厂商。近几个月在低调招芯片工程师——不公开发布职位,私下挖人。
目标是明确的:降低对英伟达的依赖。可能也对华为。
● ● ●
一家"不商业化"的公司,为什么突然搞硬件?
DeepSeek 一直以来的形象是"不商业化"。不融资、不做产品、不发 PR,闷头训模型。今年 6 月破了第一条——CNBC 报道完成首轮外部融资,估值超 500 亿美元。
当时融资的理由是"核心人才流失"。罗福莉走了,去小米做了 MiMo 团队,她带的模型在部分基准测试上已经超过 DeepSeek 自己的产品。
梁文锋给投资人提了个特殊要求:投我可以,别挖我的人。也不许鼓励他们另起炉灶。
然后到了 7 月,造芯片的消息来了。
这两件事放在一起看,模式很清晰:DeepSeek 发现自己困在一个悖论里。他们做出了全球最好的开源模型,但模型本身不挣钱。API 定价压到成本线,V4 正式版甚至搞了峰谷定价——高峰时段价格翻倍。推理成本是真实的痛。
更要命的是,做出好模型的人会被挖走。罗福莉去了小米,下一个可能是谁?
所以 DeepSeek 在两条线上同时推进:
一条是组织防御。 融资 + "不挖人"条款。拿投资人的承诺当护城河。
另一条是技术纵深。 如果最核心的成本在推理,那就自己造推理芯片。如果最稀缺的资源是人才,那就偷偷招。
● ● ●
这芯片能成吗?
说实话,没人知道。
路透社援引的分析师 Richard Windsor 说得很直白:英伟达在中国的市场份额已经基本归零了,DeepSeek 的芯片除非拿到最先进的制造工艺,否则几乎没有出口机会。对英伟达没有实际威胁。
这话对,但可能问错了问题。
DeepSeek 造芯片不是为了出口,不是为了卖。是为了自己的推理成本。他们不需要跟 H100 比——他们只需要比租用云 GPU 便宜。
推理芯片的技术门槛本来就比训练芯片低。不需要处理 TB 级数据传输,不需要支持超大规模分布式训练,也不需要搞定内存墙。就是矩阵乘法加速。大模型推理的瓶颈在显存带宽和算力密度,推理专用芯片在架构上可以比通用 GPU 高效得多。
Groq 的 LPU 已经证明了这一点:推理速度吊打 GPU,只是太贵。如果 DeepSeek 能做出"够用且便宜"的推理芯片,不需要比 Groq 快,只需要比自己现在用的 H800 便宜。
那就是成功的。
● ● ●
面试风波的另一层意思
刚好在这条芯片新闻前后,李博杰的事闹得很大。
7 月 6 日,前华为天才少年、Pine AI 首席科学家李博杰在社交平台吐槽 DeepSeek 面试:笔试通过后半个月没安排面试,反复催促才排上;面试官迟到;最离谱的是——他用双屏写代码,面试官说他"瞟左边屏幕",认定他在抄代码,要求他"证明自己没有抄"否则面试终止。
李博杰当场终止面试,公开曝光。
然后第二天,投资人杜均(火币网联合创始人)跳出来指控李博杰:拿了 50 万美元投资就失联,不提供财务报表,"合作过最没契约精神的创始人"。李博杰回应:协议约定 150 万美元只到了 50 万,后续资金不到位,他主动降薪,2024 年 10 月因家庭原因离职。
两边各执一词。但对 DeepSeek 来说,这件事有一个更直白的侧面:
他们在面一个 ACM 优博、SIGCOMM/SOSP/NSDI/PLDI 发了多篇顶会论文的人——让他写代码。
这说明两件事。第一,DeepSeek 确实在疯狂招人。第二,面试流程没跟上招人的速度。流程拖沓、面试官态度问题——这些都是快速扩张期组织的通病。
再结合"近几个月低调招聘芯片工程师"的消息,李博杰面试的岗位可能不是纯算法岗。DeepSeek 在招的不只是 AI 研究员,还有系统工程师、芯片工程师。双屏写代码被质疑抄代码——这更像是工程面试中的场景,不是研究面试。
● ● ●
所以 DeepSeek 到底在干什么?
DeepSeek 在同时做几件事:烧钱做最强模型,V4 马上正式发布,MoE 架构把推理成本压到 GPT-5 的几十分之一但绝对值仍然巨大。建组织壁垒,融资锁投资人、不挖人条款锁员工、自研芯片锁供应链。最关键的是——不做应用、不做产品,把所有资源往下砸,从模型到芯片。
这个路径和 OpenAI 完全不同。OpenAI 向上走:模型→API→ChatGPT→产品矩阵。DeepSeek 向下走:模型→芯片→?
也不是 Google 的路径。Google 的 TPU 是为了支撑自己的云服务和 Gemini,但 Google 是云厂商,卖的是算力。DeepSeek 不卖算力,只卖 API。
特斯拉做 Dojo 芯片不是为了卖芯片,是为了自己的 FSD 训练。自研芯片的逻辑很简单:你的通用方案解决不了我的特定问题。
DeepSeek 的特定问题是什么?极低成本的大规模推理。 用通用 GPU 做这件事,永远有架构上的浪费。H800 有 Tensor Core,但通用 GPU 架构里大量晶体管在做推理不需要的事——图形管线、FP64 双精度、多卡互联开销。专用推理芯片可以砍掉这些,把每平方毫米硅片都用在矩阵乘法上。
● ● ●
信号比芯片本身重要
这个芯片三年内能不能量产、能不能跑起来,其实不重要。
重要的是 DeepSeek 已经认定了一件事:光靠模型不够。
模型可以被复现。V3 出来后,阿里、字节、百度都很快做出了对标模型。V4 的 MoE 架构开源了,三个月内会有十几个开源 MoE 模型。但芯片不行。芯片的投资周期以年计,从立项到流片到量产,没有三年下不来。
这就是护城河的时间差。
DeepSeek 刚成立的时候,没人知道他们要干什么。2023 年 11 月 DeepSeek Coder 开源,大家知道了。2024 年底 V3 发布,全球震动了。2025 年 R1 出来,OpenAI 慌了。2026 年 6 月融资 500 亿估值,7 月传出造芯片。
回过头看,这个节奏不是在追风口。他们一直在往下挖。从应用层到模型层,从模型层到芯片层。
如果 DeepSeek 真的做出了推理芯片,中国 AI 行业会进入一个新阶段:谁从沙子到 API 全自己掌控,谁就有定价权。华为有昇腾,但华为是卖芯片的。DeepSeek 的芯片不卖——它是成本武器,不是收入来源。
● ● ●
一个无关的注脚
李博杰在回应投资人指控时说了一段话。他说离开 Pine AI 去面 DeepSeek,不是因为 Pine AI 不行,而是"今年初以来,我有了类似 Andrej Karpathy 的感受——在基础模型公司之外做模型、harness 和应用层系统,很多关于数据构造、模型内部指标和训练技巧的信息并不容易获得"。
换句话说,最好的 AI 研究员最终都会流向基础模型公司。而基础模型公司,最终都会走向硬件。