模型蒸馏合法吗?三个层级讲清楚
模型蒸馏是每家主流实验室都在用的标准技术。本文划出三条界线:开源到开源的合规做法、违反服务条款的做法,以及真正的盗窃。
"蒸馏"一夜之间成了敏感词。Anthropic 披露 DeepSeek、Moonshot AI 和 MiniMax 曾用 24,000 个账户系统性地提取 Claude 的能力之后,各家标题把这项技术描述成介于商业间谍与盗窃之间的行为。
这种说法有误导性。蒸馏是机器学习中使用最广泛的技术之一,真正决定性质的是你把它指向哪里。
对每一个在做 AI 的团队来说,弄清这个区别都有意义:让三家中国实验室惹上麻烦的这项技术,同时也是获得一份谁都拿不走的 AI 能力的最干净的路径。
蒸馏 101:它到底是什么
知识蒸馏出自 Geoffrey Hinton、Oriol Vinyals 和 Jeff Dean 在 2015 年的一篇论文。思路很简单:拿一个庞大而昂贵的"教师"模型,训练一个更小、更便宜的"学生"模型去模仿它的行为。
教师针对一组输入生成输出,学生学着复现这些输出。最后得到的是一个更小的模型,它以低得多的算力成本捕捉了教师能力中有用的一部分。
这是 AI 行业运转的基础做法:
- OpenAI 蒸馏自家模型,做出 GPT-4o-mini 和其他更便宜的变体
- Google 把 Gemini Ultra 蒸馏成 Gemini Flash,用于低延迟场景
- Anthropic 用内部蒸馏产出更轻量的 Claude 版本
- Meta 发布 Llama,本意就是让社区在其之上继续构建,包括通过蒸馏
每一家拥有前沿模型的实验室,都有从它派生出来的更小模型。蒸馏就是它们的做法。
合法性光谱
蒸馏与蒸馏之间差别很大。这里存在一条光谱,你处在光谱的哪一段,决定了你是在做标准的 ML 工程,还是在违反别人的服务条款。
级别 1:开源到开源(完全许可)
你拿 Llama 3 70B,用它的输出训练一个 Llama 3 7B 变体。只要说明模型的来源,Meta 的许可证明确允许这样做。Qwen 和 Mistral 的许可证有类似条款。
这相当于读一本教科书,然后写下自己的笔记。知识是公开可得的,应用是你自己的。
级别 2:闭源 API 到你自己的模型(违反服务条款)
你大规模获取 Claude 或 GPT-4 的输出,用它们训练一个竞争模型。技术过程和级别 1 完全一样,但提供商的服务条款禁止把输出用作竞争模型的训练数据。
DeepSeek、Moonshot 和 MiniMax 就落在这一档。他们按设计用途调用 API,拿到输出,再以服务条款禁止的方式二次利用这些输出。
级别 3:利用专有访问(盗窃)
你通过未经授权的途径拿到模型权重:数据泄露、内部人员、逆向工程,然后直接使用。这属于典型的知识产权盗窃,并可能构成犯罪。
DeepSeek 的情况牢牢落在级别 2。这里没有窃取权重,也没有入侵系统。他们调用 API、付费获取访问,然后以 Anthropic 服务条款禁止的方式使用输出。Anthropic 自己的博客也承认,蒸馏是"一种被广泛使用的正当训练方法",问题出在合同层面而非刑事层面。《南华早报》的分析同样指出,Anthropic 承认"蒸馏技术本身并不违法"。这是违反服务条款,而不是一场劫案,但这个区别并没有阻止事件被讲成更戏剧化的版本。
这些禁令的覆盖范围也值得注意。Anthropic 的使用政策规定,未经事先授权,不得使用其输出训练任何 AI 模型,竞争模型只是 其中一类。也就是说,适用于 DeepSeek 那种工业规模提取的同一条款,从技术上讲同样适用于一个五人 SaaS 团队拿记录下来的 API 响应去微调一个小分类器。服务条款不按规模、意图或你是否是竞争对手来区分。
为什么每个主要实验室都做蒸馏
OpenAI、Anthropic、Google 和 Meta 都在蒸馏自家模型,这件事本身就说明:这项技术能产生实实在在的价值。
内部蒸馏让实验室不必从零训练,就能提供更便宜的模型变体。GPT-4o-mini 通过蒸馏继承 GPT-4o 的能力,再针对成本和延迟做优化。
这造成了一种战略上的不对称。能造出前沿模型的实验室,可以把它蒸馏成一整条产品线。其他人要么自己造一个前沿模型(几十亿美元的量级),要么另找办法把类似的能力装进更小的壳子里。
那个"另找的办法"正是 DeepSeek 那场行动的动因。他们无法合法地蒸馏 Claude,也无法在同样的时间表内负担从零构建一个 Claude 级模型。于是他们走了一条折中路线,而这条路线最终违反了 Anthropic 的服务条款。
真正的教训是:从闭源 API 蒸馏在战略上很脆弱,哪怕你一直没被抓到。