data-cleaningdeduplicationpii-redactionquality-scoringon-premiseml-training
ML 训练数据集的本地数据清洗
在本地清洗 ML 训练数据集:MinHash 去重、文本标准化、PII 脱敏和质量评分,全程无需云端 API,数据不出内网。
Edward Xi Yang
摄入完成之后,你手上是结构化的文本。但结构化和干净是两回事。企业的文档集合里充满重复内容、编码残留、个人可识别信息、不一致的格式,以及一旦进入训练集就会拖累模型表现的低质量记录。
清洗是多数团队投入不足的环节,而一个模型在生产环境中能不能用,往往就在这一步决定。本文讲的是完全在本地清洗 ML 训练数据集的实用技术:不用云端 NER 服务,不调外部 API,数据不出门。
去重:完全重复与近似重复
训练数据里的重复会让模型在重复样本上过拟合,评估时指标虚高,泛化能力却在下降。在企业文档集合里,重复无处不在:同一份合同模板被用了 300 次,每次只有细微改动;同一份政策文件发给了每一个部门;同一封邮件在收件人之间层层转发。
完全去重
最简单的情形。对每份文档的内容计算哈希(SHA-256),删除哈希相同的记录。这能抓住逐字节相同的重复:同一个文件用不同文件名保存,或同一份文档从多个来源被重复摄入。
完全去重很快(用哈希集合可达 O(n)),应当始终作为第一步。