alitrack

Redis之父为DeepSeek抱不平,美国AI圈吵翻了

6 月 15 日晚上,Salvatore Sanfilippo 在 X 上连发了 7 条推文。

程序员圈更熟悉他的网名:antirez。他一手创造了 Redis——GitHub 7.4 万 Star、全球最流行的内存数据库。

就是这个人,深夜用带情绪的英文发了一大段话。核心意思就一句:别再说中国模型是靠偷来的了,这在数学上根本行不通。

推文发出后,AI 圈炸了。1,000 多次转发,社区注释团队给他加了个"事实不准确"的标签。Redwood Research 的首席科学家说他"明显错误"。AI2 的研究员 Nathan Lambert 也下场纠偏。

但 antirez 不是随便说说。发文的一个月前,他刚用 C 和 Metal 给 DeepSeek V4 单独写了一个推理引擎。从架构到量化到 agent 集成,他亲手跑了个遍。

他可能是全世界最有资格说这句话的局外人。

● ● ●

Anthropic 先开的炮

Image

事情要从 2 月说起。

2 月 23 日,Anthropic 发了一份技术报告,标题是《检测和防范蒸馏攻击》。报告指控三家中国 AI 公司——DeepSeek、月之暗面、MiniMax——对 Claude 实施了"工业规模的蒸馏攻击"。

数字很吓人:24,000 个虚假账户,1,600 万次交互。DeepSeek 被点名约 15 万次,月之暗面约 340 万次,MiniMax 最多,超过 1,300 万次。

所谓"蒸馏攻击",Anthropic 的描述是:用自动化程序大量调用 API,用精心设计的提示词提取 Claude 的推理能力、工具使用模式和思维链,然后拿去训练自己的模型。

OpenAI 也跟着开火。Sam Altman 向美国国会提交公开信,声称发现了 DeepSeek 的"对抗性蒸馏"证据。

但这有个细节。

Anthropic 自己在报告里承认了:蒸馏是一种广泛使用且合法的训练方法。AI 公司经常蒸馏自己的模型来创建更小、更便宜的版本。

所以争议不在蒸馏这个技术本身。真正的指控是"以欺诈方式访问 API 并违反服务条款"。只是这两个概念被绑在了一起——"蒸馏攻击"这个词听起来比"违反 ToS"严重得多。

● ● ●

Redis 之父为什么下场

Image

antirez 进入这个讨论,不是没来由的。

2026 年 5 月,他开源了 DS4——一个用 C + Metal 写的本地推理引擎,专门跑 DeepSeek V4 Flash。

不是那种改个 fork 改个配置的"适配"。从头写的。没有框架依赖,没有抽象层,只服务一个模型。做了非对称量化——MoE 专家的 up/gate 层压到 2-bit,共享专家和投影层保持 Q8 精度。做了 KV 缓存磁盘化,专门适配 Claude Code 那种每次启动就发 25K token 的场景。还实现了 OpenAI 和 Anthropic 双协议兼容层。

实测数据:M3 Max 128GB 跑到 26.7 tok/s 生成,M3 Ultra 512GB 预填充冲到 468 tok/s。对于一个 284B 参数的 MoE 模型,这已经不是"能跑",是"能用"了。

项目 README 里有一句话:

这些 2-bit 量化不是开玩笑,它们在 coding agent 下表现良好,能可靠地调用工具。

他是在 agent 环境下测的。这意味着他不仅跑通了推理,还接入了 Claude Code、opencode、Pi 这些真实开发场景,实测了 tool calling 的准确率。

但这件事还有另一面。

一个 284B 的模型,压掉 50% 比特在本地跑,还能正常干活。它的能力不可能是从 API 输出里"蒸馏"出来的。

因为蒸馏需要什么?完整 logits。每一层的概率分布。中间推理链。

API 只给你文本。没了。

● ● ●

他在数学上说了什么

Image

antirez 的 7 条推文,可以拆成四个论点。

第一层:数据不够。

经典知识蒸馏(Hinton 2015)要求学生模型在完整输出分布上模仿教师。你需要 logits——模型给每个 token 打的分数。API 只返回最终文本。不返回概率分布,也不返回思维链中间每一步的概率。

他说:"通过 API 调用来蒸馏模型,就像只看到极其复杂曲面上的几个点,却想复原整个曲面。数学上不可能。"

第二层:蒸馏的作用被严重高估。

DeepSeek R1 论文确实有蒸馏实验。但被蒸馏的模型原本就在数万亿 token 上预训练过,潜在推理能力本来就存在。蒸馏只是"激发",不是"注入"。况且 antirez 的原话是,即使经过蒸馏,"这些模型也谈不上特别强"。

第三层:真正起作用的是 RL 管线。

API 顶多为强化学习提供一些高质量信号。让模型学会推理的,是 GRPO 这类自主构建的 RL 算法、reward 模型的设计、探索策略的调优。这些是工程实力,API 给不了。

第四层:开源也复制不了。

DeepSeek 的权重和训练方法都公开了。但欧洲多家实验室拿着开源的方案和权重,也没训练出对齐 DeepSeek 的模型。如果蒸馏外部 API 就能做到,为什么照说明书都做不出来?

Image

最后一句话他写得很重——

Stop repeating this bullshit. Even if your bio says 'AI expert', you're just proving to the world that you don't understand machine learning.

● ● ●

AI 圈的回怼:你术语用错了

Image

antirez 的原帖被 X 的社区注释系统加了一条标签:"事实不准确,需要社区注释。"

Redwood Research 的首席科学家 Ryan Greenblatt 发推说:"这个帖子明显事实错误。最少它采用了一个在 LLM 语境下非标准的蒸馏定义。用少量轨迹蒸馏 RL 在很多地方已被证明。"

AI2 研究员 Nathan Lambert 说得更细。他指出了三层:

antirez 的"蒸馏"定义是 2015 年 Hinton 的版本——需要完整 logits。但 LLM 社区说"蒸馏",通常指任何用教师模型输出训练学生的做法。Alpaca 用 ChatGPT 输出微调 LLaMA 就是典型例子,已经验证可行。

Anthropic 指控的"蒸馏",技术上更准确的说法是"越狱 API 获取思维链文本"。用精心设计的提示词,让 Claude 在执行任务的同时输出内部推理过程,拿这些思维链去训练自己的模型。Lambert 认为这对特定任务的 RL 训练"确实有帮助"。

然后是最尖锐的一层。Lambert 直言:AI 公司主动使用"蒸馏"这个词,因为它模糊且带道德暗示。"蒸馏攻击"比"违反 ToS"听起来严重得多,更容易推动出口管制和安全叙事。

"这些实验室用这个词,部分目的是让话语变得混乱——就像你现在做的那样。"

康奈尔大学教授 Sasha Rush 的评论更轻松,但一样准:

"你可能是有史以来最好的程序员之一,但我猜你不知道 ML 术语完全是垃圾堆。"

● ● ●

蒸馏这词到底被怎么用了

Image

Anthropic 报告里,"蒸馏攻击"的技术路线是这样的:创建虚假账户 → 绕过地区封锁 → 发送精心设计的提示词 → 获取带思维链的回复 → 用这些文本训练模型。

而 antirez 反驳的"蒸馏",是拿来教师模型的完整 logits,做精确保真的概率分布迁移。

两个不同的东西,被同一个词绑在了一起。

Image

还有一个数字值得追问。Anthropic 说 DeepSeek 交互量"约 15 万次"。这个数字在 AI 行业什么概念?

一个普通 AI 工具日均交互量大约 16 万次。一次 SWE-bench 技术评测从头到尾能产生近 12 万次请求,反复调参优化的话,轻松超百万。15 万次,完全可能在正常评测流程中自然产生。

Nathan Lambert 和 Linux Foundation AI & Data 的 CTO Matt White 访问中国 AI 实验室后,得出了一个更朴素的结论:中国模型进步靠的不是偷,是扎实的工程师文化。

他们看到的是一群平均 25 岁的人,卷实际效果而不是个人品牌。开源是默认选项,真正的讨论是"哪些部分开源、什么时候开源"。几乎所有实验室提到 DeepSeek 的创新时都表示尊重——GRPO 算法、推理训练方法,"改变了游戏规则"。

● ● ●

他没有立场

Image

antirez 不是中国公司的人。不是 AI 政策顾问。不是投资人。

他是写 Redis 的人。GitHub 7.4 万 Star。主导这个项目 11 年,2020 年退休去写科幻小说,2024 年底才回归技术圈。

他选择在深夜连发 7 条推文的原因很简单:亲手验证过。量过量化的每一比特,跑过长上下文的每一层,测过 agent 的每一次 tool call。发现这些东西是真的——不是靠偷 API 文本堆出来的。

在整个 AI 圈的地缘政治叙事里,antirez 提供了一个罕见到几乎不存在的视角:工程事实。

他不站任何一方。他只是觉得,把一个模型用 2-bit 量化后还能跑得这么好的团队,不该被说成是"偷来的"。

这就够了。