synthetic-datamodel-distillationon-device-aidata-preparationfine-tuning
用于小模型蒸馏的合成数据
如何为低于 1B 参数的端侧模型生成和过滤合成训练数据:教师模型选择、复杂度评分、去重和格式规则。
Edward Xi Yang
构建移动 NPU 部署的 0.5B 参数模型与构建云推理的 70B 模型根本不同。模型小 140 倍。对噪声或不对齐训练数据的容忍度接近零。
标准方法——大教师模型生成示例,用于训练小学生模型——在学生为 7B-13B 时可以接受。但在学生为 0.5B-1B 时就崩溃了,因为 教师生成的文本复杂度超出了学生能再现的水平。
关键过滤策略
长度分布匹配:匹配生产输入/输出分布。 复杂度评分:在学生模型上运行困惑度,丢弃高于阈值的示例。 领域相关性评分:嵌入相似度过滤。 格式一致性强制:零容忍格式变异。
数据
| 指标 | 朴素方法 | 优化方法 |
|---|---|---|
| 生成合成示例 | 100,000 | 100,000 |
| 最终训练集 | 80,000 | 20,000 |
| 端侧准确率 | 61-68% | 84-91% |
优化方法使用 75% 更少的训练示例,达到高 20-30 个百分点的准确率。质量优于数量不是空话——在低于 1B 的规模下它是全部策略。
预约探索通话 讨论你端侧 AI 部署的合成数据策略。
Turn unstructured data into AI-ready datasets — without it leaving the building.
On-premise data preparation with full audit trail. No data egress. No fragmented toolchains. EU AI Act Article 30 compliance built in.
Keep reading
为什么你的微调数据集不适用于端侧 AI——以及如何修复
大多数微调数据集是为大型云模型构建的。当蒸馏到 0.5B-1B 模型用于移动 NPU 时,数据分布会崩溃。以下是原因以及如何构建真正适用于端侧部署的数据集。
Edward Xi Yang
从教师模型到边缘设备:模型蒸馏的数据准备工作流
当目标是计算受限的边缘设备时,准备训练数据的逐步工作流。从定义硬件约束到验证端侧性能。
Edward Xi Yang
当你的模型只有 10 亿参数时,数据分布更加重要
700 亿参数的模型可以靠蛮力处理嘈杂数据。5 亿参数的模型则不行。以下是小语言模型对数据分布问题指数级更敏感的原因,以及如何通过针对性过滤和质量评分来解决。
Edward Xi Yang