Redis之父为DeepSeek抱不平,美国AI圈吵翻了
6 月 15 日晚上,Salvatore Sanfilippo 在 X 上连发了 7 条推文。
程序员圈更熟悉他的网名:antirez。他一手创造了 Redis——GitHub 7.4 万 Star、全球最流行的内存数据库。
就是这个人,深夜用带情绪的英文发了一大段话。核心意思就一句:别再说中国模型是靠偷来的了,这在数学上根本行不通。
推文发出后,AI 圈炸了。1,000 多次转发,社区注释团队给他加了个"事实不准确"的标签。Redwood Research 的首席科学家说他"明显错误"。AI2 的研究员 Nathan Lambert 也下场纠偏。
但 antirez 不是随便说说。发文的一个月前,他刚用 C 和 Metal 给 DeepSeek V4 单独写了一个推理引擎。从架构到量化到 agent 集成,他亲手跑了个遍。
他可能是全世界最有资格说这句话的局外人。
● ● ●
Anthropic 先开的炮
事情要从 2 月说起。
2 月 23 日,Anthropic 发了一份技术报告,标题是《检测和防范蒸馏攻击》。报告指控三家中国 AI 公司——DeepSeek、月之暗面、MiniMax——对 Claude 实施了"工业规模的蒸馏攻击"。
数字很吓人:24,000 个虚假账户,1,600 万次交互。DeepSeek 被点名约 15 万次,月之暗面约 340 万次,MiniMax 最多,超过 1,300 万次。
所谓"蒸馏攻击",Anthropic 的描述是:用自动化程序大量调用 API,用精心设计的提示词提取 Claude 的推理能力、工具使用模式和思维链,然后拿去训练自己的模型。
OpenAI 也跟着开火。Sam Altman 向美国国会提交公开信,声称发现了 DeepSeek 的"对抗性蒸馏"证据。
但这有个细节。
Anthropic 自己在报告里承认了:蒸馏是一种广泛使用且合法的训练方法。AI 公司经常蒸馏自己的模型来创建更小、更便宜的版本。
所以争议不在蒸馏这个技术本身。真正的指控是"以欺诈方式访问 API 并违反服务条款"。只是这两个概念被绑在了一起——"蒸馏攻击"这个词听起来比"违反 ToS"严重得多。
● ● ●
Redis 之父为什么下场
antirez 进入这个讨论,不是没来由的。
2026 年 5 月,他开源了 DS4——一个用 C + Metal 写的本地推理引擎,专门跑 DeepSeek V4 Flash。
不是那种改个 fork 改个配置的"适配"。从头写的。没有框架依赖,没有抽象层,只服务一个模型。做了非对称量化——MoE 专家的 up/gate 层压到 2-bit,共享专家和投影层保持 Q8 精度。做了 KV 缓存磁盘化,专门适配 Claude Code 那种每次启动就发 25K token 的场景。还实现了 OpenAI 和 Anthropic 双协议兼容层。
实测数据:M3 Max 128GB 跑到 26.7 tok/s 生成,M3 Ultra 512GB 预填充冲到 468 tok/s。对于一个 284B 参数的 MoE 模型,这已经不是"能跑",是"能用"了。
项目 README 里有一句话:
这些 2-bit 量化不是开玩笑,它们在 coding agent 下表现良好,能可靠地调用工具。
他是在 agent 环境下测的。这意味着他不仅跑通了推理,还接入了 Claude Code、opencode、Pi 这些真实开发场景,实测了 tool calling 的准确率。
但这件事还有另一面。
一个 284B 的模型,压掉 50% 比特在本地跑,还能正常干活。它的能力不可能是从 API 输出里"蒸馏"出来的。
因为蒸馏需要什么?完整 logits。每一层的概率分布。中间推理链。
API 只给你文本。没了。
● ● ●
他在数学上说了什么
antirez 的 7 条推文,可以拆成四个论点。
第一层:数据不够。
经典知识蒸馏(Hinton 2015)要求学生模型在完整输出分布上模仿教师。你需要 logits——模型给每个 token 打的分数。API 只返回最终文本。不返回概率分布,也不返回思维链中间每一步的概率。
他说:"通过 API 调用来蒸馏模型,就像只看到极其复杂曲面上的几个点,却想复原整个曲面。数学上不可能。"
第二层:蒸馏的作用被严重高估。
DeepSeek R1 论文确实有蒸馏实验。但被蒸馏的模型原本就在数万亿 token 上预训练过,潜在推理能力本来就存在。蒸馏只是"激发",不是"注入"。况且 antirez 的原话是,即使经过蒸馏,"这些模型也谈不上特别强"。
第三层:真正起作用的是 RL 管线。
API 顶多为强化学习提供一些高质量信号。让模型学会推理的,是 GRPO 这类自主构建的 RL 算法、reward 模型的设计、探索策略的调优。这些是工程实力,API 给不了。
第四层:开源也复制不了。
DeepSeek 的权重和训练方法都公开了。但欧洲多家实验室拿着开源的方案和权重,也没训练出对齐 DeepSeek 的模型。如果蒸馏外部 API 就能做到,为什么照说明书都做不出来?
最后一句话他写得很重——
Stop repeating this bullshit. Even if your bio says 'AI expert', you're just proving to the world that you don't understand machine learning.
● ● ●
AI 圈的回怼:你术语用错了
antirez 的原帖被 X 的社区注释系统加了一条标签:"事实不准确,需要社区注释。"
Redwood Research 的首席科学家 Ryan Greenblatt 发推说:"这个帖子明显事实错误。最少它采用了一个在 LLM 语境下非标准的蒸馏定义。用少量轨迹蒸馏 RL 在很多地方已被证明。"
AI2 研究员 Nathan Lambert 说得更细。他指出了三层:
antirez 的"蒸馏"定义是 2015 年 Hinton 的版本——需要完整 logits。但 LLM 社区说"蒸馏",通常指任何用教师模型输出训练学生的做法。Alpaca 用 ChatGPT 输出微调 LLaMA 就是典型例子,已经验证可行。
Anthropic 指控的"蒸馏",技术上更准确的说法是"越狱 API 获取思维链文本"。用精心设计的提示词,让 Claude 在执行任务的同时输出内部推理过程,拿这些思维链去训练自己的模型。Lambert 认为这对特定任务的 RL 训练"确实有帮助"。
然后是最尖锐的一层。Lambert 直言:AI 公司主动使用"蒸馏"这个词,因为它模糊且带道德暗示。"蒸馏攻击"比"违反 ToS"听起来严重得多,更容易推动出口管制和安全叙事。
"这些实验室用这个词,部分目的是让话语变得混乱——就像你现在做的那样。"
康奈尔大学教授 Sasha Rush 的评论更轻松,但一样准:
"你可能是有史以来最好的程序员之一,但我猜你不知道 ML 术语完全是垃圾堆。"
● ● ●
蒸馏这词到底被怎么用了
Anthropic 报告里,"蒸馏攻击"的技术路线是这样的:创建虚假账户 → 绕过地区封锁 → 发送精心设计的提示词 → 获取带思维链的回复 → 用这些文本训练模型。
而 antirez 反驳的"蒸馏",是拿来教师模型的完整 logits,做精确保真的概率分布迁移。
两个不同的东西,被同一个词绑在了一起。
还有一个数字值得追问。Anthropic 说 DeepSeek 交互量"约 15 万次"。这个数字在 AI 行业什么概念?
一个普通 AI 工具日均交互量大约 16 万次。一次 SWE-bench 技术评测从头到尾能产生近 12 万次请求,反复调参优化的话,轻松超百万。15 万次,完全可能在正常评测流程中自然产生。
Nathan Lambert 和 Linux Foundation AI & Data 的 CTO Matt White 访问中国 AI 实验室后,得出了一个更朴素的结论:中国模型进步靠的不是偷,是扎实的工程师文化。
他们看到的是一群平均 25 岁的人,卷实际效果而不是个人品牌。开源是默认选项,真正的讨论是"哪些部分开源、什么时候开源"。几乎所有实验室提到 DeepSeek 的创新时都表示尊重——GRPO 算法、推理训练方法,"改变了游戏规则"。
● ● ●
他没有立场
antirez 不是中国公司的人。不是 AI 政策顾问。不是投资人。
他是写 Redis 的人。GitHub 7.4 万 Star。主导这个项目 11 年,2020 年退休去写科幻小说,2024 年底才回归技术圈。
他选择在深夜连发 7 条推文的原因很简单:亲手验证过。量过量化的每一比特,跑过长上下文的每一层,测过 agent 的每一次 tool call。发现这些东西是真的——不是靠偷 API 文本堆出来的。
在整个 AI 圈的地缘政治叙事里,antirez 提供了一个罕见到几乎不存在的视角:工程事实。
他不站任何一方。他只是觉得,把一个模型用 2-bit 量化后还能跑得这么好的团队,不该被说成是"偷来的"。
这就够了。