企业 AI 数据准备到底要花多久
摄入、清洗、标注和导出各阶段的真实工时,按语料规模估算出的总准备时间,以及企业团队最常低估工作量的那四个环节。
诚实的答案是:比你预算的时间更长,而且几乎无一例外。
60-80% 这个数字(机器学习项目中花在数据准备上的时间占比)被广泛引用,偶尔也被质疑,但凡是真正做完一轮企业 AI 项目的团队,最后都会确认它。这个数字没有说清楚的,是它对项目排期意味着什么。
如果数据准备占掉总项目时间的 60-80%,而你的项目只有 6 个月的截止期,那么光是数据 准备就要吃掉大约 3.5 到 5 个月。这段时间里不含模型训练,不含评估与迭代,也不含部署,仅仅是把数据整理成可以开始训练的形态。
多数项目计划并没有体现这一点。它们通常给“数据预处理”留 3-4 周,剩下的 4-5 个月分给其余所有环节。发现时间线其实是倒过来的,往往发生在第 6 周:数据准备的第一轮已经跑完,产出的质量却还达不到开始训练的要求。
本文给出具体的基准数字,方便你按照现实的量级来排期。
决定时间线的几个变量
时间线的差异极大,主要取决于四个因素:
1. 源文件格式的质量。 来自现代文档管理系统的原生 PDF 解析得又快又干净。1990 年代档案里的扫描件则需要 OCR、纠偏和人工质检。同样名义上是“1,000 份文档”的语料,原生格式可能 8 小时处理完,扫描件要 40 小时以上。
2. 数据体量。 这里指文本总量,而不是文件数量。10,000 份简短表单和 10,000 份信息密集的技术报告,是两个完全不同的问题。
3. 标注复杂度。 在文档级别把文档分成 5 类很快。在专业领域(临床术语、法律条款、工程部件)按 token 级别标注命名实体则很慢。
4. 团队构成与工具链。 用电子表格手工清洗,和跑一条自动化去重管道,是两回事;领域专家能自己打开标注工具,和每次都要 ML 工程师在旁协助,也是两回事。这两个乘数带来的差距都很大。
各阶段的时间基准
摄入
摄入耗时主要由文件格式和是否需要 OCR 决定。
| 源文件格式 | 每小时页数(自动化) | 错误率 | 人工复核需求 |
|---|---|---|---|
| 原生 PDF(版式干净) | 5,000-15,000 | < 1% | 极少 |
| 原生 PDF(复杂多栏) | 1,000-3,000 | 2-5% | 表格校验 |
| 扫描 PDF(质量好,300+ DPI) | 500-1,500 | 2-8% | 抽查 |
| 扫描 PDF(质量差,混杂) | 100-400 | 10-25% | 大量 |
| Word(.docx) | 10,000-30,000 | < 1% | 极少 |
| Excel(.xlsx,结构简单) | 5,000-20,000 张表 | 1-3% | 表头校验 |
| 音频转录 | 2-5 倍实时时长 + 复核 | 5-15% | 说话人与术语订 正 |
以上是自动化处理的速率。正式跑批之前,每一类语料还要再加 4-16 小时的准备时间,用于配置管道、验证样本和调参。
清洗
清洗时间更难估,因为它取决于摄入阶段留下的错误率,以及合规方面的要求。
| 任务 | 时间估算 |
|---|---|
| 自动化去重(50,000 条记录) | 1-4 小时计算 + 2-4 小时验证 |
| PII/PHI 脱敏(标准模式) | 2-8 小时计算 + 4-8 小时抽样审计复核 |
| 质量打分与过滤 | 2-6 小时计算 + 2-4 小时阈值校准 |
| 人工清理 OCR 残留错误 | 错误较多的页面每页 1-3 分钟 |
其中人工清洗那一项最难预测。如果相当一部分文档的 OCR 质量都很差,人工订正就会变成决定整体时间线的那一环。一份 10,000 页的语料,若页面级错误率为 5%,就有 500 页需要人工处理;按每页 2 分钟算,单个标注员要投入 16 个多小时。
标注
标注几乎总是耗时最长的阶段,也几乎总是被低估得最厉害的阶段。
| 任务 | 每条记录耗时 | 10,000 条记录 |
|---|---|---|
| 文档分类(5 类) | 15-30 秒 | 40-80 小时 |
| 文档分类(20 类以上) | 30-90 秒 | 80-250 小时 |
| NER 标注(3-5 种实体) | 2-5 分钟 | 330-830 小时 |
| NER 标注(10 种以上实体,技术领域) | 5-15 分钟 | 830-2,500 小时 |
| 边界框标注(简单目标) | 1-3 分钟 | 165-500 小时 |
| 按段落生成问答对 | 10-20 分钟 | 1,650-3,300 小时 |
| 撰写指令微调样本对 | 15-45 分钟 | 2,500-7,500 小时 |
上面的数字假设标注员是已经校准过、且工作节奏稳定的领域专家。校准之前的头几轮标注,还要额外加上 30-50% 的时间,用来消化不一致和返工。
按这个速率,为一个复杂的 NER 任务标注 10,000 条记录需要 800-2,500 小时的专家工时。单个标注员每周 40 小时,就是 20-63 周。多数项目等不起这么久,于是只剩三条路:增加标注人手、缩小范围,或者用数据增强把一份规模更小、质量更高的标注集扩充开。
增强
用本地 LLM 做自动化数据增强,速度取决于模型推理,通常每小时产出 50-500 条合成记录,具体看记录长度和硬件。加上环境搭建和对合成样本的质量复核,再花 4-16 小时。这通常是整条流程里最快的阶段。
导出
只要格式规范写清楚、校验也已经自动化,导出通常很快,以小时计而不是以天计。格式校验失败(schema 报错、编码问题)如果拖到很晚才发现,会额外增加 4-16 小时的排查时间。
省掉清洗带来的复合代价
有些团队为了赶截止期,或者觉得清洗“像是额外开销”,就把这一步跳过或草草了事,接下来面对的是一个会不断放大的问题。
用含 10% 近似重复记录的数据训练出来的模型,会以过高的置信度复述那些高频内容。用含 2% PII 污染的数据训练出来的模型,上线后会把 PII 吐出来。用含 5% OCR 损坏的数据训练出来的模型,产出里 会带着这些损坏痕迹。
代价是随之而来的一整轮循环:训练、评估、定位、修复、再训练。如果清洗问题一直拖到模型评估阶段才被发现(此时距离训练开始已经过去数周),额外增加的总时间等于:定位数据问题的时间 + 清洗时间 + 重新训练的时间 + 重新评估的时间。这个总和通常是在正确阶段做好清洗的 2-4 倍。
团队一贯低估的地方
遗留扫描文档的 OCR 质量。 排期之前没有真正核查过档案扫描质量的团队,往往默认 OCR 结果“差不多够用”。150 DPI 扫描、带倾斜、墨迹褪色、印刷质量参差的文档,OCR 出来的文本离 AI 训练数据的要求还差得远。这一点通常要等到摄入阶段结束、清洗阶段暴露出错误率时才被发现。
积累多年的档案里的近似重复率。 企业文档库是自然堆积起来的,没有人策展过:邮件附件、版本另存、模板套用、复制粘贴,都会往里加东西。去重之前,真正可用的训练数据量往往只有表面体量的 60-75%。
标签一致性与校准所需的时间。 团队会默认领域专家对标签自然会有共识;第一轮标注下来,他们很少能对得上。校准这件事包括精确定义标签体系、跑一轮试标、测量标注员间一致性 、裁决分歧、再用修订后的体系重标一遍,正式标注开始之前要花 2-6 周。
目标框架的格式要求。 等标注做完才发现训练框架要求的 JSONL schema 和导出格式对不上,就得返工重排格式;如果 schema 的变化影响到标注怎样映射到输出,有时还得重新标注。
一张粗略的基准表
| 语料规模 | 格式 | 标注类型 | 估计总准备时间 |
|---|---|---|---|
| 1,000 份文档 | 原生 PDF,结构简单 | 文档分类 | 2-4 周 |
| 1,000 份文档 | 扫描 PDF | 文档分类 | 4-8 周 |
| 10,000 份文档 | 原生 PDF,版式混杂 | NER(5 种实体) | 3-6 个月 |
| 10,000 份文档 | 扫描 PDF | NER(5 种实体) | 5-10 个月 |
| 50,000 份文档 | 混合格式 | 指令微调样本对 | 6-18 个月 |
| 100,000 份以上文档 | 混合格式 | 多任务标签 | 12 个月以上 |
这些估算假设团队规模较小(2-4 人,其中至少 1 名 ML 工程师,并且领域专家能随时投入)。团队更大可以按比例压缩日历时间,但要扣掉维持标注一致性带来的额外开销。
工具链如何影响时间线
手工流程(用 Python 脚本清洗、拿电子表格做质量复核、临时拼凑的标注工具)产出的时间线,稳定地比带质量卡点的自动化管道长 2-4 倍。
复合效应体现在这几处:
- 手工去重按天算,自动化去重按小时算
- 手工审查 PII 要把每一份文档都读一遍;自动检测加人工抽样审计只需要读 5-10%
- 标注工具如果每次开工都要 ML 工程师帮忙配置,有效标注时间会直接翻倍
- 每换一个导出目标就要重写一遍的格式转换脚本,会给导出阶段再加上好几天
对大型项目来说,管道自动化是刚需。一个 3 人团队要准备 10,000 份文档的 NER 语料,工具链完善的管道和纯手工流程之间的差距,就是 3 个月项目和 9 个月项目的差距。
Ertas Data Suite 把摄入、清洗、去重和 PII 脱敏这几个阶段自动化,并提供基于浏览器的标注界面,领域专家无需安装任何东西就能使用。根据已经在用这条管道的团队反馈,仅自动化的这几个阶段,就能把总准备时间比脚本式管道缩短 40-60%。
相关阅读
- 企业 AI 数据管道的五个阶段:每个阶段实际会发生什么,团队通常卡在哪里。
- 企业 AI 数据准备指南:完整的策略图景,包括动手之前如何界定一个数据准备项目的范围。
- 碎片化数据准备栈的成本:在整条管道上使用 3-7 个独立工具带来的复合成本。
Turn unstructured data into AI-ready datasets — without it leaving the building.
On-premise data preparation with full audit trail. No data egress. No fragmented toolchains. EU AI Act Article 30 compliance built in.