slmdata-qualityfine-tuningdata-preparation
小语言模型的数据准备:质量优于数量
大模型可以暴力处理嘈杂数据。小模型不行。对于 SLM,数据质量不仅仅是重要的——它是决定模型能否工作的决定性因素。
Edward Xi Yang
大语言模型——700 亿参数及以上——对杂乱训练数据的容忍度惊人。它们庞大的参数量给予足够的容量来吸收矛盾、容忍噪声,并仍然提取有用的模式。如果 5% 的训练示例标签不正确,700 亿模型几乎不会注意到。
小语言模型——30 亿到 140 亿参数——没有这种奢侈。参数更少,每个训练示例对模型行为的影响成比例地更大。一个在 2,000 个示例上微调的 70 亿模型给予每个示例大 约 350 万参数的影响。一个坏示例不只是增加噪声——它积极地扭曲模型学习的模式。
这就是 SLM 数据悖论:最实用的部署模型(小型、快速、运行成本低)是对训练数据要求最高的模型。
为什么小模型不宽容
模型大小和数据质量容忍度之间的关系不是线性的——而是指数级的:
700 亿以上模型: 可以容忍 5-10% 的标签噪声并仍然表现良好。
140 亿模型: 容忍 3-5% 的标签噪声,然后性能开始明显下降。
70 亿模型: 容忍不到 3% 的标签噪声。2,000 个纯净示例始终优于 10,000 个普通示例。
30 亿模型: 基本上零容忍标签噪声。这些模型需要近乎完美的训练数据。