准备合成解析管道:2026 年文档处理方法
2026 年文档处理不再是一个模型的工作。合成解析管道将文档分解为部分并将每个路由到专门模型。以下是如何为此架构准备数据。
过去,文档处理由一个模型包办。把 PDF 丢给 OCR 引擎,取回文本,必要时在旁边再跑一遍表格提取器,最后手工把各路输出拼在一起。
这套做法在 2024 年前后触到了天花板。企业文档太复杂了:一份施工规范里既有叙述 性正文,又有以嵌套表格呈现的工程量清单、带尺寸标注的技术图纸、展示项目进度的图表,还有把这些内容彼此串起来的交叉引用。没有哪个模型能把所有这些内容类型都处理好。
2026 年的做法是合成解析管道:一种多阶段架构,先把文档拆成若干组件,每个组件路由到擅长它的专门模型,再把各路输出重新组合成单一的结构化表示。之所以称为"合成",是因为最终结果由多个模型各自的产出汇合而成。
本文聚焦数据准备这一侧:如何为管道的每个阶段制作训练数据。
管道架构
合成解析管道有四个阶段,每个阶段都需要属于自己的训练数据。
阶段 1:布局检测器
布局检测器逐页扫描并识别区域:正文在哪里?表格在哪里?图形在哪里?页眉和页脚又在哪里?
输出是一组边界框,每个框标注一种区域类型:text_block、table、figure、header、footer、caption、page_number、sidebar、watermark。
这本质上是一个目标检测问题,通常用 LayoutLMv3、DiT(Document Image Transformer)或在文档版式上训练过的 YOLO 变体来解决。
阶段 2:文本提取器
布局检测器识别出的文本区域会送入文本提取阶段。这一阶段从每个文本区域产出干净、有结构的文本,同时处理字体、分栏、阅读顺序和特殊字符。
阶段 3:表格解析器
表格区域交给专门的表格解析模型,由它理解行列结构、合并单元格、多级表头以及跨页表格。
阶段 4:图像分析器
图形区域交给视觉模型,由它判定图形类型(图表、示意图、照片、图纸)并抽取其中相关的结构化信息。
合并器
合并器把各阶段的输出汇总成单一的结构化文档表示,解析交叉引用,并保持文档原有的逻辑结构。
这四个阶段都能通过在领域数据上微调而变得更好。下面逐一说明各阶段的训练数据该怎么准备。
布局检测器的数据准备
你需要什么
已标注的文档页面,页面上每个区域都框出边界框并归好类。这是一项目标检测标注任务,和在自然图像上训练 YOLO 所用的标注方 式相同,只是对象换成了文档页面。
标注流程
第 1 步:挑选有代表性的页面。 不必把每份文档的每一页都标。挑出 200 到 500 页,覆盖管道将会遇到的各种版式。其中应包含:
- 文字密集的页面(报告、叙述性内容)
- 表格密集的页面(财务报表、工程量清单)
- 混排页面(表格连带周围的正文和图注)
- 图形页面(技术图纸、图表)
- 复杂页面(多栏版式、侧边栏、嵌套元素)
第 2 步:定义区域类别。 面向企业文档的一套实用类别:
text_block:连续的正文(段落、项目符号列表)table:具有行列结构的表格数据figure:图片、图表、图纸、示意图header:页眉、章节标题footer:页脚、脚注caption:给图或表作说明的文字page_number:页码sidebar:侧栏或标注框中的内容watermark:需要忽略的背景文字或图案
先从较少的类别起步,只有当管道确实需要这层区分时才增加。对企业文档来说,九个类别通常够用。
第 3 步:标注边界框。 逐页把每个区域框起来,并指定对应类别。使用支持边界框的标注工具(CVAT、LabelImg,或任何支持目标检测标注的平台)。
几条关键的标注准则:
- 框要贴紧,留白尽量少
- 区域重叠时按最具体的类型标注(图注压在图形上时标成
caption,而非figure) - 多栏页面按栏分别标框
- 跨页表格在每一页上各标一个框
第 4 步:质量校验。 安排第二位标注员复核其中 20% 的标注。区域分类的标注员一致率应高于 90%,边界框坐标的偏差 应控制在 5% 以内。
规模要求
针对自家文档类型微调的布局检测器:
- 下限: 200 个标注页面,区域分类准确率可达 88% 到 92%。
- 推荐: 500 个标注页面,准确率可达 93% 到 96%。
- 理想: 1,000 页以上,在版式稳定的文档上准确率可达 96% 到 98%。
如果文档使用统一模板(同一种报告格式、同一种发票版式),200 页往往就够。面对来源混杂的文档集合(多个供应商、多种格式),目标定在 500 页以上。
文本提取器的数据准备
你需要什么
每个文本区域的标准答案文本 :也就是本应从页面该区域提取出来的正确纯文本。
制作标准答案
数字版 PDF(带文本层): PDF 内嵌的文本可以直接充当标准答案,但要先校验。内嵌文本有时会有编码错误、阅读顺序错乱或字符缺失。
做法是:用程序从 PDF 中抽取文本,人工抽查 50 到 100 个区域,修正其中成规律出现的提取错误。若内嵌文本稳定正确(字符准确率高于 98%),就直接用作标准答案;达不到这个水平,就得靠人工转录。
扫描件(纯图像): 标准答案只能靠人工转录。这项工作很耗人力,但要在自家文档类型上训练出准确的 OCR 模型,就绕不开它。
工时估算:人工转录一个文本区域视长度需要 1 到 3 分钟。500 个标注页面、每页平均 5 个文本区域,就是 2,500 个区域 × 2 分钟 ≈ 83 小时。分摊到一个小组身上,大约是 2 到 3 周的工作量。
特殊字体或符号: 如果文档中出现领域专用符号(工程标注、数学公式、乐谱记号),务必确保它们在标准答案里被正确记录。通用 OCR 模型在这类符号上常常出错,而微调后的模型能学会它们,前提是标准答案里真的收录了这些符号。
规模要求
- 下限: 500 个带标准答案的文本区域
- 推荐: 2,000 个文本区域
- 理想: 5,000 个以上文本区域,以在多种字体和版式上取得最高准确率
表格解析器的数据准备
你需要什么
每张表的结构化标准答案:正确的行列结构,连同单元格取值、合并单元格信息和表头关系。
难点所在
表格解析的标准 答案是整条管道里最复杂的标注。单单一张表就要求:
- 判定行数和列数
- 把每个单元格的内容映射到它的行列位置
- 标出合并单元格及其跨度(例如第 1 行中横跨第 2 到 4 列的单元格)
- 区分表头行与数据行
- 处理嵌套表头(多级列结构)
- 串联跨页表格
单条标注的工作量因此远高于文本转录或画边界框。
标注流程
第 1 步:梳理文档中的表格类型。 企业文档里常见的表格类型:
- 简单表格(规整网格,无合并单元格)
- 表头带合并单元格的表格
- 行列表头嵌套的表格
- 单元格内含多行文字的表格
- 跨页表格
- 带小计和总计的表格
先把表格归类,这样才能确保各种类型都有覆盖。
第 2 步:定义输出格式。 标准答案要用一种能完整表达表格各类关系的结构化格式。一个实用的格式:
{
"rows": 15,
"columns": 5,
"headers": [
{"text": "Item", "row": 0, "col": 0, "rowspan": 1, "colspan": 1},
{"text": "Description", "row": 0, "col": 1, "rowspan": 1, "colspan": 1},
{"text": "Specifications", "row": 0, "col": 2, "rowspan": 1, "colspan": 3}
],
"cells": [
{"text": "1.01", "row": 1, "col": 0},
{"text": "Concrete Grade 30", "row": 1, "col": 1},
...
]
}第 3 步:标注表格。 逐张表产出结构化标准答案。可以用支持合并单元格和多级表头的表格标注工具,也可以导出到电子表格里人工整理结构。
工时估 算:简单表格每张 5 到 10 分钟;带合并单元格和嵌套表头的复杂表格每张 15 到 30 分钟。按这个量级排预算。
第 4 步:校验。 做一次往返校验:把结构化标准答案重新渲染成可视表格,再与原表比对。出现差异就说明标注有误。
规模要求
由于结构上的复杂性,表格解析需要的训练数据比布局检测更多:
- 下限: 300 张带标准答案的表格,足以应付简单表格结构。
- 推荐: 1,000 张表格,可应付合并单元格和常规表头结构。
- 理想: 2,000 张以上,可应付复杂的嵌套表头、跨页表格和不规则结构。
第 1 步中梳理出的每种表格类型,至少要收进 50 个样例。