← 主页
DEEP DIVE · 取证专题

模型蒸馏与来源取证
Distillation & Provenance Forensics

白宫指控 Moonshot「蒸馏」了 Anthropic 的 Fable 模型——蒸馏到底是什么?偷师一个模型在技术上怎么操作?取证方又凭什么说「你的模型是抄的」?本文讲清这场争端背后的完整技术底座。

📅 调研时间:2026-07-24🔍 基于 10+ 来源交叉验证⏱ 约 20 分钟读完

01🗺️ 30 秒速览

模型蒸馏(distillation)是让一个「学生」模型向一个更强的「老师」模型学习的技术:学生不直接从原始数据里苦学,而是学习老师对问题的回答方式,用远低于从头训练的成本获得老师的大部分能力。它本身完全合法且被所有大厂天天使用——争议只在一件事上:未经许可,把竞争对手的模型当老师。这相当于花几百万美元的 API 调用费,收割别人几十亿美元训练投入的成果。

来源取证(provenance forensics)是它的对立面:模型权重不带「出生证明」,蒸馏出的学生权重和老师长得完全不一样,所以取证只能靠行为层面的间接证据——统计学指纹、身份混淆、水印残留。这也是为什么本周白宫的指控轰动业界,却依然「强烈暗示、无法铁证」。

老师模型 耗资数十亿美元训练 (如 Claude Fable) 学生模型 以极低成本习得能力 (如被指控的 K3) 蒸馏:海量提问 → 学老师的回答 取证:从学生行为里找老师的「指纹」 攻防不对称:蒸馏只需 API 权限,取证却拿不到对方权重
蒸馏与取证是一对攻防:一个方向是能力转移,反方向是行为鉴定。
🎯 读完你能回答的三个问题① 蒸馏在技术上分几种、黑盒 API 蒸馏具体怎么做?② 交叉熵分析、水印「放射性」这些取证手段的原理是什么、能不能当铁证?③ 作为用模型/开 API 的工程团队,这场争端和你有什么关系?

02📰 事件背景:Kimi K3 风波是怎么烧起来的

先把这一周的时间线捋清楚——它是全文所有技术概念的「案发现场」。

7 月 16 日 · K3 发布Moonshot 发布 2.8 万亿参数 Kimi K3,登顶 Frontend Code Arena,对 Claude Fable 5 胜率 76%,成为史上最大开源权重(预告)模型 发布后 · 异常被发现社区记录到 K3 在对话中自称「Claude,由 Anthropic 开发」;Redwood Research 的 Ryan Greenblatt 发布跨模型交叉熵统计分析 7 月 22 日 · 白宫点名指控OSTP 主任 Kratsios 公开指控:①「大规模隐蔽工业蒸馏」Fable;② 经泰国获取受出口管制的 Nvidia GB300 芯片 7 月 27 日 · 权重放出(原计划)K3 开源权重原定放出——每个想自托管它的企业都被卷入争议
2026 年 7 月 K3 事件时间线。图源信息:Build Fast with AI 7 月 23 日汇总报道。

为什么这次不一样?过去的蒸馏争议(如今年早些时候 Anthropic 对阿里的指控,以及更早 OpenAI 与 DeepSeek 之间的争议)都停留在公司层面;这次是美国政府高官首次点名指控具体中国实验室蒸馏具体美国模型,而且被指控的恰好是刚刚在编码榜单上击败了「老师」的明星开源模型。指控若成立,「中国开源模型逼近美国前沿」的叙事就要改写为「抄近道」;若不成立,则是政府背书了一个错误的技术判断。

⚠️ 事实边界(本文的诚实声明)截至调研时(2026-07-24),这是指控而非法律认定:Moonshot 未公开回应,无任何法院或监管裁决。「K3 自称 Claude」和交叉熵分析是公开可查的证据,但两者都存在无辜解释(见第 5 节)。本文只讲技术,不裁决是非。

03🧪 蒸馏是什么:从「合法日常」到「灰色地带」

🍵 先有痛点,才有蒸馏

大模型有个天然矛盾:越强的模型越大、越贵、越慢。一个万亿参数的旗舰模型效果好,但推理成本高到没法给每个用户随便用。厂商的解法就是蒸馏:先训练一个超强的大模型,再让小模型「拜师学艺」,把大模型的能力压缩进一个便宜、快速的小身体里。你平时用到的各家「mini / flash / lite」型号,几乎都是这么来的——蒸馏自己的模型,是全行业的标准操作

是什么

知识蒸馏(Knowledge Distillation):让小的「学生」模型模仿大的「老师」模型的输出来训练。经典做法(源自 Hinton 等人提出的思路)是让学生学习老师的软标签——不是只学「正确答案是 A」,而是学老师给出的完整概率分布(「A 90%、B 7%、C 3%」)。这个分布里藏着老师对「哪些选项接近、哪些荒谬」的理解,信息量远大于一个标准答案。

为什么有效

从头训练要靠海量原始数据「悟」出规律;蒸馏则相当于直接抄老师消化好的「笔记」。同样的能力,学生需要的数据量和算力都大幅下降——这正是它既是宝贵技术、又是「偷师」利器的原因。

例子

训练时的损失函数通常是两项加权:对真实标签的交叉熵损失 + 对老师软标签的 KL 散度损失(让学生的分布向老师靠拢)。这是教科书级的标准配方。

🔗 类比从头训练像自己啃十年原始文献成为专家;蒸馏像跟着一位名师学三年——名师已经替你消化了那十年文献,你学的是他讲出来的「精华版」。跟自家师傅学天经地义;翻墙进别家武馆偷学,还开馆招徒,就是本周争议的全部内容

🔀 关键分野:白盒蒸馏 vs 黑盒蒸馏

能不能拿到老师的「内部数据」,决定了蒸馏的两种形态——这也是理解「API 蒸馏为什么防不胜防」的关键。

蒸馏 能拿到老师内部信息吗? 白盒蒸馏(能) 直接用老师的 logits / 概率分布训练 信号丰富、效率高 前提:自家模型,或权重公开 → 厂商做 mini 版的日常操作 黑盒蒸馏(不能) 只能调 API,拿到最终生成文本 用海量「问题→回答」对做监督微调 任何有 API key 的人都做得到 → 争议案例几乎全在这一侧
同一门技术,两种获取途径:白盒学「思考过程」,黑盒学「说出的话」。
💬 没看懂 logits?点这里换种说法

模型每生成一个词之前,内部其实给词表里每一个候选词都打了分(这些分数叫 logits,归一化后就是概率分布)。白盒蒸馏能看到全部打分——相当于看到老师的完整心路;黑盒蒸馏只能看到最后写出来的那个词——相当于只能看老师交的卷子。看卷子学得慢些,但卷子看得够多(几百万上千万条),照样能学出七八分功力。

学术界近年把这套谱系整理得更细:HuggingFace 上的《On-Policy Distillation 综述》按三个维度组织蒸馏方法——反馈信号(logit 级 / 结果级 / 自博弈)、老师访问权限(白盒 / 黑盒 / 无老师)、损失粒度(token 级 / 序列级 / 混合)。记住一点即可:「老师访问权限」这个维度里的「黑盒」,就是所有跨厂商争议的温床

软标签 / soft targets
老师输出的完整概率分布,比「唯一正确答案」信息量大得多
SFT 蒸馏
用「问题→老师回答」文本对做监督微调,黑盒场景的主力做法
On-Policy 蒸馏
让学生自己生成回答、老师逐 token 点评纠偏,比离线抄答案更高效的新范式
合成数据
由模型生成的训练数据——黑盒蒸馏的产物本质上就是一大批合成数据

04⚙️ 黑盒 API 蒸馏怎么运作:一条完整流水线

📎 需先理解上一节的「黑盒蒸馏」概念

被指控的「工业级蒸馏」不是黑客攻击,不需要入侵任何系统——它用的都是合法可购买的 API 访问,难堵就难堵在这里。一条典型流水线长这样(以下为业界公认的通用流程,非对任何具体公司行为的描述):

准备提示词库收集/生成几百万到上亿条覆盖目标能力面的问题:代码、数学、推理、写作、多轮对话……想学老师哪一面,就往哪一面提问。
大规模采集老师回答通过 API(往往用大量分散账号规避风控)批量提问并存储回答。对被指控方而言这是最烧钱的一步,但相比从头训练的成本仍是零头。
清洗与过滤去掉拒答、报错、低质量回答;有时会刻意清洗「我是 XX 模型」之类的身份声明——清洗不干净,就成了日后取证的把柄。
训练学生模型把「问题→老师回答」对当作监督微调数据训练自己的模型;更进阶的做法结合拒绝采样、偏好优化(如 DPO 类方法)进一步逼近老师的行为风格。
混合与掩盖蒸馏数据通常会与自采网络数据、自产合成数据混合训练,既提升泛化、也稀释「指纹」。这一步直接决定了取证的难度。
数十亿 $
老师模型的训练投入
~API 账单
黑盒蒸馏的主要成本
76%
K3 对 Fable 5 的竞技场胜率(独立评测,与训练来源无关)
💡 为什么厂商如此紧张蒸馏动摇的是前沿实验室的商业根基:如果任何人都能用 API 账单的成本复刻你的旗舰能力,再开源放出、按白菜价提供服务,那几十亿美元训练投入的护城河就成了给全行业修的桥。这也是为什么(据 Build Fast with AI 报道)OpenAI、Anthropic、Google 今年开始共享情报联防协同蒸馏行为——竞争对手在这件事上成了盟友。

05🔬 取证:凭什么说「你的模型是抄的」?

先明确取证为什么难:模型权重不带水印,蒸馏出的学生权重和老师毫无相似之处——没有「对比源代码」这回事。取证只能退而求其次,从行为下手:学生是否以「随机巧合无法解释」的频率,复现老师特有的怪癖、拒答模式、格式习惯、身份混淆?下面按「证据强度从弱到强」讲四类手段。

👣 手段一:身份混淆(轶事级证据)

K3 被记录自称「Claude,由 Anthropic 开发」。听起来像实锤,其实是最弱的一类证据:Claude 的对话记录在公开互联网上到处都是,任何用网络数据训练的模型都会吃进一些,偶尔「口误」自称 Claude 的模型并不罕见;残留的系统提示词、角色扮演泄漏、公开数据集里混入的 Claude 对话都能造成同样现象。一张截图什么也证明不了

📊 手段二:交叉熵 / 统计指纹分析(本周的主角)

是什么

Redwood Research 的 Ryan Greenblatt 对多个模型做了交叉熵分析:测量每个模型对特定文本的「惊讶程度」(交叉熵低=模型觉得这段文本很自然=更可能见过类似分布)。结论是 K3 在身份类问题上自称 Claude 的频率显著超出其他模型的基线,难以用随机噪声解释

为什么比截图强

单个样本可以是巧合,跨大量提示词、对照多模型基线的系统性偏差不容易是巧合。这就把「轶事」升级成了「统计证据」——据报道,同类手法也曾用于此前 Anthropic 对阿里的蒸馏指控。

局限

它仍是间接证据:只能说明「K3 的训练数据里 Claude 痕迹异常浓」,无法区分「主动蒸馏」和「网络数据污染特别严重」。研究者本人也公开承认了这些无辜解释的存在。

同一批探测提示词身份 / 风格 / 怪癖类问题 喂给嫌疑模型 K3 喂给一批对照模型 对比交叉熵分布谁对 Claude 式文本「不惊讶」? 系统性偏离基线 = 训练谱系可疑但仍需排除:网络数据污染 / 公开数据集混入
交叉熵取证的核心逻辑:不看单个回答,看嫌疑模型相对一群对照模型的统计偏差。
🔗 类比像论文查重:一句话相似可能是巧合,但如果一篇论文在几百处与某篇文献的措辞习惯、冷僻用例、甚至错别字都一致,查重系统就会亮红灯。交叉熵分析就是给模型做的「行为查重」——只是模型世界里没有「原文数据库」,只能拿一群对照模型当参照系。

💧 手段三:水印「放射性」(事前埋点,证据更硬)

前两种都是「事后侦查」,水印是「事前布防」。厂商在自家模型的输出里嵌入统计水印(生成时对某些 token 施加人眼不可见的偏好)。关键性质是学界所说的放射性(radioactivity):如果别人拿你带水印的输出去训练模型,水印偏好会像放射性同位素一样「遗传」给学生模型,事后可以从学生的输出里检测出来。arXiv 上的 TextSeal 论文(2026)正是这个方向:一种面向来源证明与蒸馏防护的局部化水印,实验演示了把 DeepSeek-R1-Distill-Qwen-14B 蒸馏进 Qwen2.5-3B 后,Gumbel-Max、TextSeal、SynthID 等水印方案仍可检出。

🧬 手段四:MoE 专家签名(前沿研究)

另一条 arXiv 路线(Leave It to the Experts)提出:混合专家(MoE,模型内部由多个「专家」子网络分工,每个 token 只激活少数专家)模型的专家路由模式本身构成一种签名,可用于检测未授权蒸馏。对 2.8 万亿参数级的 MoE 模型时代,这是值得关注的新取证面。

⚖️ 四类证据放在一起看

手段时机证据强度主要弱点
身份混淆截图事后⭐ 轶事级数据污染即可解释,单例无意义
交叉熵 / 行为指纹事后⭐⭐⭐ 统计级无法区分「蒸馏」与「重度污染」
水印放射性需事前部署⭐⭐⭐⭐ 较硬只覆盖部署水印之后的输出;强改写/混合训练会稀释
MoE 专家签名研究阶段⭐⭐(待验证)尚在论文阶段,未经大规模争议实战检验
⚠️ 核心结论现有取证手段能做到「强烈暗示」,做不到「铁证如山」。这正是行业困境:蒸馏的技术有效性和证据的天然模糊性同时成立,所以争端会反复出现。业界真正缺的不是下一次指控,而是一套模型来源的技术标准(水印、训练数据审计、可验证声明)。

06🛡️ 防御:API 厂商的四道工事

取证是亡羊补牢,厂商更想把羊圈修好。据公开报道,当前的防御体系大致四层,由外到内:

① 条款层 · ToS 明令禁止明确禁止用 API 输出训练竞争模型 → 提供法律追责抓手 ② 流量层 · 速率限制 + 查询模式检测识别「海量、系统性、覆盖式提问」的采集特征,封禁账号集群 ③ 输出层 · 统计水印输出自带「放射性」标记,被拿去训练也能事后检出 ④ 联防层 · 跨厂商情报共享OpenAI / Anthropic / Google 共享协同蒸馏行为情报
四层防御:法律抓手 → 流量风控 → 输出埋点 → 行业联防。没有一层是完美的,叠加才有威慑。

每一层都有漏洞:条款约束不了不在乎条款的人;流量检测可被大量分散账号和代理稀释;水印会被改写、翻译、与其他数据混合训练削弱;联防只覆盖愿意联防的厂商。这解释了一个看似矛盾的现象——防御明明一直在收紧,大规模蒸馏指控却越来越多:攻击成本低、收益巨大、抓到也难定罪,经济学上这件事就不会停。

📌 顺带一提:对正常用户的「误伤」风控收紧的副作用是正常的高频 API 用户(评测跑分、批量数据处理、Agent 集群)更容易触发蒸馏疑似检测。如果你的业务有「短时间大量覆盖式提问」的形态,值得提前和厂商沟通配额与白名单,免得被当成采集流水线。

07🧭 对工程团队的影响:三个该分开的问题

如果你在用开源模型或评估 K3 这类模型,本周的争议对你意味着什么?Build Fast with AI 的分析给了一个很实用的框架:把三个经常被混为一谈的问题拆开

问题性质谁来回答
① 这个模型好不好用?可测量:跑自己的工作负载,竞技场胜率、Terminal-Bench 等独立评测不因指控而失效工程团队
② 它的训练来源干不干净?取证问题,证据天然模糊,工程团队无法也不必裁决留给取证方与法律程序
③ 用它会不会给我带来风险?合规问题:有政府合同、严格 IP 要求、并购计划的企业,「来源存疑」会在尽调中被翻出来法务 / 合规

对应的行动建议(综合本周多方分析的社区共识,供参考):

🎯 一句话立场工程师严谨地测性能,把来源争议上交而不是裁决——把这个分工写清楚的组织,行动会比分工模糊的组织快得多。

08🙅 常见误区澄清

误区一:「蒸馏 = 偷窃」

不是。蒸馏是中性的、被普遍使用的合法技术,各家的 mini/flash 型号都靠它。有争议的只是「未经许可以竞品为老师」这一种用法——而且它违反的是 ToS 与 IP 层面的约束,目前尚无判例明确其法律定性。

误区二:「模型自称 Claude 就是实锤」

不是。互联网上到处是 Claude 对话记录,正常抓取网络数据训练的模型也会偶发同样口误。有价值的是统计层面的系统性偏差(交叉熵分析),而即便是它也只能指向「训练数据里 Claude 痕迹异常浓」,给不出唯一解释。

误区三:「查一下权重不就知道了?」

查不出。蒸馏传递的是行为而非参数,学生和老师的权重没有任何可比对的相似性。这正是所有取证只能从行为、水印、路由签名这些侧面下手的根本原因。

误区四:「被指控的模型跑分是假的」

混淆了两件事。K3 的竞技场胜率与 Terminal-Bench 成绩是独立评测方测出来的,不因训练来源争议而失效;争议影响的是合规与声誉,不是能力本身。当然反过来说,「能力是真的」也不构成对来源问题的辩护。

09📚 学习资源清单

事件与背景

技术深入

继续追踪