PostgreSQL码农集散地

阿里暂未回应, “蒸馏”这笔账到底该怎么算

前几天疯传的 Anthropic 指控阿里“蒸馏攻击” Claude 模型, 相信大家有刷到过, 我随便放一篇, 没看过的朋友可以回顾一下: 阿里一周两次硬刚美国:起诉五角大楼、回击AI同行抹黑

其实这也不是 Anthropic 第一次用此类话题进行炒作. 早在2026 年 2 月 24 日,Anthropic 发布了一份措辞强硬的声明:他们发现 DeepSeek、Moonshot AI 和 MiniMax 三家 AI 公司,通过约 2.4 万个虚假账户,累计与 Claude 模型进行了超过 1600 万次交互。Anthropic 称之为"工业级蒸馏攻击"。

声明发布后,马斯克在社交媒体上评论了一句耐人寻味的话:"贼喊抓贼。"因为 Anthropic 就是靠训练互联网的各类数据起家的.

抛开蒸馏这件事的真实性我们先不谈, 毕竟是 Anthropic 一家之言.

我们今天重点拆解一下: 如果一家公司决定去蒸馏另一个公司的 AI 模型,它到底能得到什么、付出什么、值不值得?

只听不看, 欢迎订阅视频号: 

蒸馏这件事,本质上是在"复印"一本你买不起的书

你手边有一本 Encyclopaedia Britannica(大英百科全书),但你没有原版。你有一台复印机,每次复印一页要付 10 美分。你打算复印整本书——但这本书有 32,640 页。

复印完后你得到了一本和原版内容一模一样的书。但复印的过程中,你需要注意几件事:第一,原书有防复印技术,你复印出来的部分页面模糊不清;第二,复印 3 万页需要的费用比你预想的要高;第三,如果出版社发现你在复印,可能会起诉你。

蒸馏大模型,本质上就是这么一回事。

教师模型(被蒸馏的 Claude)就是那本原版百科全书,学生模型(蒸馏者自己训练的小模型)就是你复印出来的副本。你复印的目的不是拥有一本书,而是想用复印的成本(API 调用费)替代买书(从零自研)的成本。

站在 AI 工程师的显微镜下看,蒸馏的技术原理是这样的:你通过 API 反复调用 Claude,把它的回答——不只是最终答案,还有它给出的推理过程、置信度分布、甚至它"犹豫"时的中间输出——全部收集起来,然后用这些"带答案的题目"去训练你自己的小模型。

小模型不需要理解"为什么这样回答",它只需要学会"遇到这种输入,就输出类似的答案"。这就像复印不需要理解印刷术一样。

但复印不是万能的。

技术上有三扇门,任何一扇打不开,收益都会打折

我见过太多人把蒸馏描述成"开个 API 调用就能偷走能力"——这严重低估了中间的工程难度。实际上,从"决定蒸馏"到"蒸馏出可用模型",要过三扇门。

第一扇门:数据获取。 你得拿到足够多、足够高质量的 Claude 输出。1600 万次交互听起来很多,但这不是"1600 万条可用训练数据"。API 输出有大量噪声——截断的回答、安全过滤后的空白、重复的提示词、格式不一致的回复。实际能用于训练的高质量数据,可能只有 10%-30%。更关键的是,Anthropic 不是傻子——一旦检测到异常调用模式,他们可以实时调整输出质量:加水印、降低推理深度、注入噪声。数据获取不是一次性的,是持续的攻防战。

第二扇门:模型容量。 你的学生模型必须足够大,才能装得下从 Claude 那里"偷"来的能力。这不是说你要造一个和 Claude 一样大的模型——那还不如直接自研。关键在于找到一个"性价比最优"的容量点。DeepSeek 的实践提供了一个参考:他们用 70B 参数量的 R1-Distill 模型,在数学推理任务上达到了接近 OpenAI o1 的水平。但 70B 不是随便选的——如果你只用 7B 模型去蒸馏,大概率只能学到表面模式,真正的推理能力迁移不了。

第三扇门:蒸馏效果的上界。 这是最容易被忽略的门。蒸馏能传递"已知答案的模式",但很难帮助学生在训练数据分布之外的区域产生原创性推理。你可以让一个 7B 模型通过蒸馏学会做数学题(因为数学题的答案是结构化的),但你很难让它通过蒸馏学会写出一篇有独特观点的深度分析文章——因为"独特观点"本质上不在教师模型的输出概率分布里。

站在科技战略的角度看这三扇门,你会发现蒸馏不是一条捷径,而是一条有多个检查点的窄路。过每一扇门都需要付出额外的工程成本,而且门与门之间是串联关系——任何一扇过不去,整体收益都会打折甚至归零。

商业上算一笔账:蒸馏省的钱,到底有多少?

不谈技术可行性,单从商业逻辑出发,蒸馏的吸引力来自一个简单的算术:自研太贵了。

DeepSeek-V3 的技术报告披露,他们的预训练只消耗了 278.8 万 H800 GPU 小时,成本约 557.6 万美元。这个数字已经是大模型行业里的"省钱标杆"了——比同规模模型的预期成本低了一个数量级,这得益于 DeepSeek 在算法(MoE 架构、MLA 注意力机制)、框架(DualPipe 流水线并行)和硬件调度上的极致优化。

但 557.6 万美元对一个没有量化交易印钞机的创业公司来说,仍然是一个需要融资才能覆盖的巨额投入。训练还不是全部——后面还有数据清洗、对齐、安全测试、部署优化,每一项都是时间和金钱。

那么蒸馏能省多少钱?

我们来估算一下。假设要蒸馏出覆盖推理、代码、工具调用等核心能力的训练数据,需要调用 Claude API 100 万次。按平均每次调用 1000 输入 token + 500 输出 token 计算,使用 Opus 模型的总成本大约是(100 万 × 1000 / 1M × 75)= 37,500 = 10,500。

API 账单看起来确实不贵。 但这是最理想的情况——实际中,账户被封、代理网络费用、数据清洗成本、法律风险敞口,这些隐性成本很容易让总支出翻几倍。

更重要的是,DeepSeek-R1 的案例提供了一个有趣的对照:他们的 R1 模型训练仅用了 512 颗 H800 芯片、大约 80 小时、29.4 万美元(不含基础模型)。这说明如果你有工程技术能力,自研的成本正在快速下降。DeepSeek 证明了一件事:557.6 万美元不是铁律,而是一个可以被工程优化打穿的数字。

站在商业决策的角度,这意味着蒸馏的 ROI 是一个不断移动的目标。当自研成本快速下降时,蒸馏的相对优势在缩小。但反过来,如果你的时间窗口极短(比如需要在 6 个月内拿出一个能用的模型),蒸馏仍然是速度最快的路径。

所以蒸馏的商业价值不是一个固定数字,而是一个"时间压力 × 自研成本 × 蒸馏效果"的函数。 时间压力越大、自研成本越高、蒸馏效果越好,蒸馏的吸引力就越大。

法律的灰色地带:最确定的不是"能不能赢",而是"能不能脱身"

技术可行、商业划算,不代表你可以做。这正是法律顾问要提醒的事。

让我把蒸馏的法律风险拆成四层,从最确定到最不确定:

第一层,也是最确定的一层:服务条款违约。 只要你在注册 Claude API 时点了"同意",Anthropic 的服务条款就对你产生了法律约束力。这些条款中通常明确禁止"用 API 输出训练竞争性模型"或"批量自动化调用"。违反 ToS 就是违约,账户封禁是最轻的后果,更严重的可能涉及追偿 API 费用、甚至法律诉讼。这一层的确定性很高——不在于"能不能告赢",而在于"不需要告,直接封你号就够了"。

第二层:版权侵权的模糊地带。 这里的问题是:Claude 的输出,是否构成受版权保护的作品?如果是,用这些输出去训练另一个模型,是否构成"衍生作品"?在美国,这个问题尚无明确司法先例。欧盟的态度更倾向于保护数据权利人——Getty Images 起诉 Stability AI 的案件(进行中)可能成为分水岭。在中国,《生成式 AI 服务管理暂行办法》要求训练数据必须合法,但"API 输出是否属于合法获取的训练数据"尚无明确规定。

第三层:商业秘密。 如果蒸馏行为导致模型权重、推理逻辑或专有训练技术被反向工程,API 提供商可能以商业秘密侵权起诉。美国《保护商业秘密法》(DTSA)允许最高双倍赔偿加律师费,赔款金额可以非常可观。但核心争议在于:模型推理的"黑盒"内容是否构成"商业秘密"——这个问题在司法实践中仍在探索。

第四层:数据保护。 如果 API 输出中包含个人身份信息或其他受 GDPR 或中国数据安全法保护的内容,蒸馏数据跨境传输可能触发数据保护合规问题。GDPR 的最高罚款是全球年营收的 4%——对于任何有国际业务的公司来说,这都是一个不可忽视的数字。

所以站在法律风险门口看,账户被封是最轻的代价,而如果卷入跨国诉讼,代价可能是天文数字。

灰色地带不是安全地带。它只是暂时没人管你。

能偷走多少?一张"蒸馏能力迁移图"

蒸馏到底能把 Claude 的多少能力搬到另一个模型上?我用一张图来说明:

Image

这张图的关键洞察是:蒸馏擅长迁移"结构化能力",不擅长迁移"涌现性能力"。 代码生成和数学推理是有明确结构和评价标准的能力,蒸馏能学到大部分。但安全对齐(让模型不说有害内容)和实时知识(知道上周发生了什么)是蒸馏几乎无法迁移的——前者是训练过程中通过 RLHF 精心调校的隐性知识,后者是蒸馏数据本身不包含的信息。

这意味着,蒸馏出来的模型看起来"挺像那么回事",但在关键的安全性和时效性上,它是另一个物种。

最终判断:蒸馏是一门"有用但危险的技术"

把三个视角拼在一起,我得到的结论是这样的:

技术上,蒸馏确实能迁移一部分能力,特别是在代码和数学推理等结构化任务上。但它有硬性上界——通用推理能力、安全对齐和实时知识无法通过蒸馏迁移。这个上界不是"暂时技术不够好",而是信息论的基本约束:每一次知识转移都会损失信息,你不可能从输出中恢复教师模型的全部内部状态。

商业上,蒸馏的经济吸引力是真实存在的,尤其是在时间窗口紧迫、自研资源不足的情况下。但随着自研成本的快速下降(DeepSeek 证明了 557.6 万美元就能训出接近 GPT-4 水平的模型),蒸馏的 ROI 优势在收窄。对大多数有融资支持的 AI 公司来说,更务实的策略可能是"用蒸馏快速启动 + 用自研建立壁垒"的混合路径,而不是纯依赖 API 蒸馏。

法律上,这是最需要认真对待的一层。服务条款违约是最确定的追责依据,账户封禁只是最轻的后果。版权和商业秘密的法律边界虽然模糊,但灰色地带不等于安全地带。跨司法管辖区的执法难度确实存在,但这只是降低了被追责的概率,而不是降低了被追责的后果。

未来走势观察

如果你真正关心这个领域的走向——不是看热闹,而是想知道自己所在的公司或行业会受到什么影响——接下来 6-12 个月盯住这四个信号:

  1. 东方 AI 公司的公开 benchmark 排名:如果新模型在 MMLU、HumanEval、GSM8K 上的表现持续提升,且不依赖蒸馏声明,说明自研路径正在证明其可行性。DeepSeek-R1 在 MATH-500 上达到 97.3% 已经是一个信号。

  2. Anthropic 和 OpenAI 的反蒸馏措施升级:如果他们大规模部署输出水印、概率分布扰动或异常检测 API,说明他们内部认定蒸馏威胁属实。这是最直接的"攻防战升级"信号。

  3. Getty v. Stability AI 等版权案件的判决:如果 Getty 胜诉,将开创"使用他人内容训练模型需要授权"的先例,蒸馏的法律风险敞口将彻底改变。

  4. 各国 AI 监管框架的落地节奏:欧盟 AI Act 全面实施、美国可能的《AI 知识产权保护法案》、中国《生成式 AI 服务管理暂行办法》的执行细则——任何一个主要市场的监管落地,都会改变蒸馏的 ROI 计算。