白宫指控 Moonshot「蒸馏」了 Anthropic 的 Fable 模型——蒸馏到底是什么?偷师一个模型在技术上怎么操作?取证方又凭什么说「你的模型是抄的」?本文讲清这场争端背后的完整技术底座。
模型蒸馏(distillation)是让一个「学生」模型向一个更强的「老师」模型学习的技术:学生不直接从原始数据里苦学,而是学习老师对问题的回答方式,用远低于从头训练的成本获得老师的大部分能力。它本身完全合法且被所有大厂天天使用——争议只在一件事上:未经许可,把竞争对手的模型当老师。这相当于花几百万美元的 API 调用费,收割别人几十亿美元训练投入的成果。
而来源取证(provenance forensics)是它的对立面:模型权重不带「出生证明」,蒸馏出的学生权重和老师长得完全不一样,所以取证只能靠行为层面的间接证据——统计学指纹、身份混淆、水印残留。这也是为什么本周白宫的指控轰动业界,却依然「强烈暗示、无法铁证」。
先把这一周的时间线捋清楚——它是全文所有技术概念的「案发现场」。
为什么这次不一样?过去的蒸馏争议(如今年早些时候 Anthropic 对阿里的指控,以及更早 OpenAI 与 DeepSeek 之间的争议)都停留在公司层面;这次是美国政府高官首次点名指控具体中国实验室蒸馏具体美国模型,而且被指控的恰好是刚刚在编码榜单上击败了「老师」的明星开源模型。指控若成立,「中国开源模型逼近美国前沿」的叙事就要改写为「抄近道」;若不成立,则是政府背书了一个错误的技术判断。
大模型有个天然矛盾:越强的模型越大、越贵、越慢。一个万亿参数的旗舰模型效果好,但推理成本高到没法给每个用户随便用。厂商的解法就是蒸馏:先训练一个超强的大模型,再让小模型「拜师学艺」,把大模型的能力压缩进一个便宜、快速的小身体里。你平时用到的各家「mini / flash / lite」型号,几乎都是这么来的——蒸馏自己的模型,是全行业的标准操作。
知识蒸馏(Knowledge Distillation):让小的「学生」模型模仿大的「老师」模型的输出来训练。经典做法(源自 Hinton 等人提出的思路)是让学生学习老师的软标签——不是只学「正确答案是 A」,而是学老师给出的完整概率分布(「A 90%、B 7%、C 3%」)。这个分布里藏着老师对「哪些选项接近、哪些荒谬」的理解,信息量远大于一个标准答案。
为什么有效从头训练要靠海量原始数据「悟」出规律;蒸馏则相当于直接抄老师消化好的「笔记」。同样的能力,学生需要的数据量和算力都大幅下降——这正是它既是宝贵技术、又是「偷师」利器的原因。
例子训练时的损失函数通常是两项加权:对真实标签的交叉熵损失 + 对老师软标签的 KL 散度损失(让学生的分布向老师靠拢)。这是教科书级的标准配方。
能不能拿到老师的「内部数据」,决定了蒸馏的两种形态——这也是理解「API 蒸馏为什么防不胜防」的关键。
模型每生成一个词之前,内部其实给词表里每一个候选词都打了分(这些分数叫 logits,归一化后就是概率分布)。白盒蒸馏能看到全部打分——相当于看到老师的完整心路;黑盒蒸馏只能看到最后写出来的那个词——相当于只能看老师交的卷子。看卷子学得慢些,但卷子看得够多(几百万上千万条),照样能学出七八分功力。
学术界近年把这套谱系整理得更细:HuggingFace 上的《On-Policy Distillation 综述》按三个维度组织蒸馏方法——反馈信号(logit 级 / 结果级 / 自博弈)、老师访问权限(白盒 / 黑盒 / 无老师)、损失粒度(token 级 / 序列级 / 混合)。记住一点即可:「老师访问权限」这个维度里的「黑盒」,就是所有跨厂商争议的温床。
📎 需先理解上一节的「黑盒蒸馏」概念
被指控的「工业级蒸馏」不是黑客攻击,不需要入侵任何系统——它用的都是合法可购买的 API 访问,难堵就难堵在这里。一条典型流水线长这样(以下为业界公认的通用流程,非对任何具体公司行为的描述):
先明确取证为什么难:模型权重不带水印,蒸馏出的学生权重和老师毫无相似之处——没有「对比源代码」这回事。取证只能退而求其次,从行为下手:学生是否以「随机巧合无法解释」的频率,复现老师特有的怪癖、拒答模式、格式习惯、身份混淆?下面按「证据强度从弱到强」讲四类手段。
K3 被记录自称「Claude,由 Anthropic 开发」。听起来像实锤,其实是最弱的一类证据:Claude 的对话记录在公开互联网上到处都是,任何用网络数据训练的模型都会吃进一些,偶尔「口误」自称 Claude 的模型并不罕见;残留的系统提示词、角色扮演泄漏、公开数据集里混入的 Claude 对话都能造成同样现象。一张截图什么也证明不了。
Redwood Research 的 Ryan Greenblatt 对多个模型做了交叉熵分析:测量每个模型对特定文本的「惊讶程度」(交叉熵低=模型觉得这段文本很自然=更可能见过类似分布)。结论是 K3 在身份类问题上自称 Claude 的频率显著超出其他模型的基线,难以用随机噪声解释。
为什么比截图强单个样本可以是巧合,跨大量提示词、对照多模型基线的系统性偏差不容易是巧合。这就把「轶事」升级成了「统计证据」——据报道,同类手法也曾用于此前 Anthropic 对阿里的蒸馏指控。
局限它仍是间接证据:只能说明「K3 的训练数据里 Claude 痕迹异常浓」,无法区分「主动蒸馏」和「网络数据污染特别严重」。研究者本人也公开承认了这些无辜解释的存在。
前两种都是「事后侦查」,水印是「事前布防」。厂商在自家模型的输出里嵌入统计水印(生成时对某些 token 施加人眼不可见的偏好)。关键性质是学界所说的放射性(radioactivity):如果别人拿你带水印的输出去训练模型,水印偏好会像放射性同位素一样「遗传」给学生模型,事后可以从学生的输出里检测出来。arXiv 上的 TextSeal 论文(2026)正是这个方向:一种面向来源证明与蒸馏防护的局部化水印,实验演示了把 DeepSeek-R1-Distill-Qwen-14B 蒸馏进 Qwen2.5-3B 后,Gumbel-Max、TextSeal、SynthID 等水印方案仍可检出。
另一条 arXiv 路线(Leave It to the Experts)提出:混合专家(MoE,模型内部由多个「专家」子网络分工,每个 token 只激活少数专家)模型的专家路由模式本身构成一种签名,可用于检测未授权蒸馏。对 2.8 万亿参数级的 MoE 模型时代,这是值得关注的新取证面。
| 手段 | 时机 | 证据强度 | 主要弱点 |
|---|---|---|---|
| 身份混淆截图 | 事后 | ⭐ 轶事级 | 数据污染即可解释,单例无意义 |
| 交叉熵 / 行为指纹 | 事后 | ⭐⭐⭐ 统计级 | 无法区分「蒸馏」与「重度污染」 |
| 水印放射性 | 需事前部署 | ⭐⭐⭐⭐ 较硬 | 只覆盖部署水印之后的输出;强改写/混合训练会稀释 |
| MoE 专家签名 | 研究阶段 | ⭐⭐(待验证) | 尚在论文阶段,未经大规模争议实战检验 |
取证是亡羊补牢,厂商更想把羊圈修好。据公开报道,当前的防御体系大致四层,由外到内:
每一层都有漏洞:条款约束不了不在乎条款的人;流量检测可被大量分散账号和代理稀释;水印会被改写、翻译、与其他数据混合训练削弱;联防只覆盖愿意联防的厂商。这解释了一个看似矛盾的现象——防御明明一直在收紧,大规模蒸馏指控却越来越多:攻击成本低、收益巨大、抓到也难定罪,经济学上这件事就不会停。
如果你在用开源模型或评估 K3 这类模型,本周的争议对你意味着什么?Build Fast with AI 的分析给了一个很实用的框架:把三个经常被混为一谈的问题拆开。
| 问题 | 性质 | 谁来回答 |
|---|---|---|
| ① 这个模型好不好用? | 可测量:跑自己的工作负载,竞技场胜率、Terminal-Bench 等独立评测不因指控而失效 | 工程团队 |
| ② 它的训练来源干不干净? | 取证问题,证据天然模糊,工程团队无法也不必裁决 | 留给取证方与法律程序 |
| ③ 用它会不会给我带来风险? | 合规问题:有政府合同、严格 IP 要求、并购计划的企业,「来源存疑」会在尽调中被翻出来 | 法务 / 合规 |
对应的行动建议(综合本周多方分析的社区共识,供参考):
不是。蒸馏是中性的、被普遍使用的合法技术,各家的 mini/flash 型号都靠它。有争议的只是「未经许可以竞品为老师」这一种用法——而且它违反的是 ToS 与 IP 层面的约束,目前尚无判例明确其法律定性。
不是。互联网上到处是 Claude 对话记录,正常抓取网络数据训练的模型也会偶发同样口误。有价值的是统计层面的系统性偏差(交叉熵分析),而即便是它也只能指向「训练数据里 Claude 痕迹异常浓」,给不出唯一解释。
查不出。蒸馏传递的是行为而非参数,学生和老师的权重没有任何可比对的相似性。这正是所有取证只能从行为、水印、路由签名这些侧面下手的根本原因。
混淆了两件事。K3 的竞技场胜率与 Terminal-Bench 成绩是独立评测方测出来的,不因训练来源争议而失效;争议影响的是合规与声誉,不是能力本身。当然反过来说,「能力是真的」也不构成对来源问题的辩护。