模型蒸馏合法吗?三个层级讲清楚
模型蒸馏是每家主流实验室都在用的标准技术。本文划出三条界线:开源到开源的合规做法、违反服务条款的做法,以及真正的盗窃。
"蒸馏"一夜之间成了敏感词。Anthropic 披露 DeepSeek、Moonshot AI 和 MiniMax 曾用 24,000 个账户系统性地提取 Claude 的能力之后,各家标题把这项 技术描述成介于商业间谍与盗窃之间的行为。
这种说法有误导性。蒸馏是机器学习中使用最广泛的技术之一,真正决定性质的是你把它指向哪里。
对每一个在做 AI 的团队来说,弄清这个区别都有意义:让三家中国实验室惹上麻烦的这项技术,同时也是获得一份谁都拿不走的 AI 能力的最干净的路径。
蒸馏 101:它到底是什么
知识蒸馏出自 Geoffrey Hinton、Oriol Vinyals 和 Jeff Dean 在 2015 年的一篇论文。思路很简单:拿一个庞大而昂贵的"教师"模型,训练一个更小、更便宜的"学生"模型去模仿它的行为。
教师针对一组输入生成输出,学生学着复现这些输出。最后得到的是一个更小的模型,它以低得多的算力成本捕捉了教师能力中有用的一部分。
这是 AI 行业运转的基础做法:
- OpenAI 蒸馏自家模型,做出 GPT-4o-mini 和其他更便宜的变体
- Google 把 Gemini Ultra 蒸馏成 Gemini Flash,用于低延迟场景
- Anthropic 用内部蒸馏产出更轻量的 Claude 版本
- Meta 发布 Llama,本意就是让社区在其之上继续构建,包括通过蒸馏
每一家拥有前沿模型的实验室,都有从它派生出来的更小模型。蒸馏就是它们的做法。
合法性光谱
蒸馏与蒸馏之间差别很大。这里存在一条光谱,你处在光谱的哪一段,决定了你是在做标准的 ML 工程,还是在违反别人的服务条款。
级别 1:开源到开源(完全许可)
你拿 Llama 3 70B,用它的输出训练一个 Llama 3 7B 变体。只要说明模型的来源,Meta 的许可证明确允许这样做。Qwen 和 Mistral 的许可证有类似条款。
这相当于读一本教科书,然后写下自己的笔记。知识是公开可得的,应用是你自己的。
级别 2:闭源 API 到你自己的模型(违反服务条款)
你大规模获取 Claude 或 GPT-4 的输出,用它们训练一个竞争模型。技术过程和级别 1 完全一样,但提供商的服务条款禁止把输出用作竞争模型的训练数据。
DeepSeek、Moonshot 和 MiniMax 就落在这一档。他们按设计用途调用 API,拿到输出,再以服务条款禁止的方式二次利用这些输出。
级别 3:利用专有访问(盗窃)
你通过未经授权的途径拿到模型权重:数据泄露、内部人员、逆向工程,然后直接使用。这属于典型的知识产权盗窃,并可能构成犯罪。
DeepSeek 的情况牢牢落在级别 2。这里没有窃取权重,也没有入侵系统。他们调用 API、付费获取访问,然后以 Anthropic 服务条款禁止的方式使用输出。Anthropic 自己的博客也承认,蒸馏是"一种被广泛使用的正当训练方法",问题出在合同层面而非刑事层面。《南华早报》的分析同样指出,Anthropic 承认"蒸馏技术本身并不违法"。这是违反服务条款,而不是一场劫案,但这个区别并没有阻止事件被讲成更戏剧化的版本。
这些禁令的覆盖范围也值得注意。Anthropic 的使用政策规定,未经事先授权,不得使用其输出训练任何 AI 模型,竞争模型 只是其中一类。也就是说,适用于 DeepSeek 那种工业规模提取的同一条款,从技术上讲同样适用于一个五人 SaaS 团队拿记录下来的 API 响应去微调一个小分类器。服务条款不按规模、意图或你是否是竞争对手来区分。
为什么每个主要实验室都做蒸馏
OpenAI、Anthropic、Google 和 Meta 都在蒸馏自家模型,这件事本身就说明:这项技术能产生实实在在的价值。
内部蒸馏让实验室不必从零训练,就能提供更便宜的模型变体。GPT-4o-mini 通过蒸馏继承 GPT-4o 的能力,再针对成本和延迟做优化。
这造成了一种战略上的不对称。能造出前沿模型的实验室,可以把它蒸馏成一整条产品线。其他人要么自己造一个前沿模型(几十亿美元的量级),要么另找办法把类似的能力装进更小的壳子里。
那个"另找的办法"正是 DeepSeek 那场行动的动因。他们无法合法地蒸馏 Claude,也无法在同样的时间表内负担从零构建一个 Claude 级模型。于是他们走了一条折中路线,而这条路线最终违反了 Anthropic 的服务条款。
真正的教训是:从闭源 API 蒸馏在战略上很脆弱,哪怕你一直没被抓到。
为什么从闭源 API 蒸馏是糟糕的战略
先把伦理放在一边。就算你能毫无后果地从 Claude 或 GPT-4 蒸馏,这依然是个糟糕的战略选择。
你拿到的是通用能力,而不是领域专长。 从 GPT-4 蒸馏出来的模型知道 GPT-4 知道的东西,也就是什么都懂一点、什么都不精。它不会理解你客户的术语、你所在行业的边缘情况,或者你产品的具体要求。你得到的是更便宜的通才,而不是专家。
你会继承教师的弱点。 如果 GPT-4 在某些话题上会产生幻觉,你蒸馏出的模型也会。如果 Claude 在你的领域有盲区,这些盲区会一并传给学生。你无法修复自己控制不了的东西。
你无法迭代。 业务需求变化时,你没法重新训练教师,没法往它的训练集里加新样本,也没法为新场景调整它的行为。你被锁死在别人某个时间点上的能力快照里。
一套检测系统就能让你失去一切。 Anthropic 抓到了这些行动,之后还会抓到更多,检测技术只会越来越强。把业务依赖建立在一项违反提供商服务条款的技术上,等于建立在借来的时间上。
在开源模型上用你自己的数据微调:不违反服务条款,不依赖供应商。查看 Ertas 定价 →
更好的路径:在开源模型上用你自己的数据微调
有一种模型蒸馏的做法完全合法、战略上稳健,而且在领域特定的应用上效果更好。它是这样的:
第 1 步:从开源基础模型出发。 Llama 3、Qwen 2.5、Mistral、Gemma 的许可证都允许商业使用和创建衍生模型。你把权重下载下来,它们就是你的。
第 2 步:把基础模型(或更大的变体)当作教师,跑在你的数据上。 让 Llama 70B 处理你的领域文档、客服记录或产品数据,生成把模型通用智能和你的领域上下文结合起来的训练样本。这是合法的蒸馏:开源模型到开源模型,中间掺进你自己的专有数据。
第 3 步:用这些样本微调一个更小的模型。 拿 Llama 7B 或 14B,在你刚造出的数据集上微调。得到的模型既有通用语言能力,又深入理解你的具体领域。
第 4 步:导出并部署。 导出成 GGUF 格式,在 Ollama、llama.cpp、LM Studio 或任何兼容的推理引擎上运行。没有 API 调用,没有按 token 计费,没有供应商依赖。
这才是真正的模型所有权该有的样子。基础模型你控制(开源),训练数据你控制(你的),微调后的模型你控制(你的),部署你控制(你的基础设施)。
没人能把它下线,没人能改价格,没人能撤销你的访问权限,没人能封你的账号。
自有模型胜过复制模型
蒸馏这场讨论里经常被忽略的一点是:在你的领域数据上微调出来的模型,在你的特定任务上通常胜过前沿模型的蒸馏副本。
这有点反直觉。在通用基准上,GPT-4 的能力客观上强于一个 7B 参数的模型。但通用基准衡量的东西,和生产应用真正在意的东西是两回事。
真正要紧的是:模型理解你客户的术语吗?它能稳定遵守你的输出格式吗?它能处理你所在行业的边缘情况吗?它产出的结果符合你的质量标准吗?
GPT-4 的蒸馏副本给你一个压缩过的通才。用 500 到 2,000 条你特定任务的样本微调出来的 7B 模型,给你一个准确率达到 90% 到 95% 的专家,在范围明确的窄任务上往往能追平甚至超过经过提示工程的 GPT-4。
一家 B2B SaaS 公司用自己的工单数据微调,测得 94% 的分类准确率。同一个任务用提示工程的 GPT-4 只有 71%。这 23 个百分点的差距,就是"基本能用"和"可以上生产"之间的距离。
蒸馏出来的模型是通用的,微调出来的模型是你的。一个是商品,另一个是竞争优势。
伦理判断框架
如果你想要一个简单的蒸馏决策框架:
源模型是带宽松许可证的开源模型吗? 放心用。Llama、Qwen、Mistral 都可以,蒸馏、微调、商业部署都行,只要遵守相应场景下的署名要求。
源模型在闭源 API 后面吗? 不要拿它的输出当训练数据。原因是这会违反服务条款、带来法律风险,而且效果不如用你自己的数据微调。
你有领域特定的数据吗? 对你的场景来说,用自己的数据微调,效果好 过从任何通用模型蒸馏,无论闭源还是开源。你的数据是你的不对称优势,用起来。
你需要压缩一个已经属于你的模型吗? 把你自己微调好的模型从 70B 蒸馏到 7B 再部署。这就是混合方案,质量和效率同时拿到,而且全程在你的掌控之内。
DeepSeek 的故事真正警示的是对不属于自己的 AI 系统的依赖。技术本身是可靠的,问题在于你把它用在自己能掌控的地基上,还是用在随时可能被抽走的地基上。
这对开发者意味着什么
如果你在构建 AI 驱动的产品或服务,路径很清楚:
- 用开源基础模型。 质量已经够了,Llama 3、Qwen 2.5 和 Mistral 都可以直接上生产。
- 在训练数据上投入。 你的领域数据就是你的护城河。整理它、清洗它、结构化它。
- 针对你的具体任务微调。 别将就通用模型,构建真正理解你业务的模型。
- 拥有结果。 导出成 GGUF,按你的条件部署,控制你的成本。
你不需要开 24,000 个假账户,不需要担心违反服务条款,也不需要依赖任何单一的 AI 提供商。
你需要的只是你的数据和一条微调流水线。
彻底绕开灰色地带。用 Ertas 微调你自己的模型:从数据集到 GGUF 的完整管线,无需编码。查看套餐 →
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
从OpenAI API迁移到微调本地模型
将最高量AI工作负载从OpenAI API迁移到自有微调本地模型的90天具体计划,包含评估基线、训练指南和分阶段切换策略。
模型蒸馏:服务条款与知识产权法
OpenAI、Anthropic、Mistral 和 xAI 的服务条款对模型蒸馏究竟禁止了什么,为什么著作权在这里几乎派不上用场,以及开源许可在哪些地方真正给你留下了合法的自由空间。
如何合法蒸馏开源模型
当教师模型的许可证允许衍生作品时,模型蒸馏就是合法的。如何选择开源教师模型、训练学生模型并导出为 GGUF。