Back to blog
    synthetic-parsingdocument-processingpipeline2026data-preparation

    准备合成解析管道:2026 年文档处理方法

    2026 年文档处理不再是一个模型的工作。合成解析管道将文档分解为部分并将每个路由到专门模型。以下是如何为此架构准备数据。

    Edward Xi Yang

    过去,文档处理由一个模型包办。把 PDF 丢给 OCR 引擎,取回文本,必要时在旁边再跑一遍表格提取器,最后手工把各路输出拼在一起。

    这套做法在 2024 年前后触到了天花板。企业文档太复杂了:一份施工规范里既有叙述性正文,又有以嵌套表格呈现的工程量清单、带尺寸标注的技术图纸、展示项目进度的图表,还有把这些内容彼此串起来的交叉引用。没有哪个模型能把所有这些内容类型都处理好。

    2026 年的做法是合成解析管道:一种多阶段架构,先把文档拆成若干组件,每个组件路由到擅长它的专门模型,再把各路输出重新组合成单一的结构化表示。之所以称为"合成",是因为最终结果由多个模型各自的产出汇合而成。

    本文聚焦数据准备这一侧:如何为管道的每个阶段制作训练数据。

    管道架构

    合成解析管道有四个阶段,每个阶段都需要属于自己的训练数据。

    阶段 1:布局检测器

    布局检测器逐页扫描并识别区域:正文在哪里?表格在哪里?图形在哪里?页眉和页脚又在哪里?

    输出是一组边界框,每个框标注一种区域类型:text_blocktablefigureheaderfootercaptionpage_numbersidebarwatermark

    这本质上是一个目标检测问题,通常用 LayoutLMv3、DiT(Document Image Transformer)或在文档版式上训练过的 YOLO 变体来解决。

    阶段 2:文本提取器

    布局检测器识别出的文本区域会送入文本提取阶段。这一阶段从每个文本区域产出干净、有结构的文本,同时处理字体、分栏、阅读顺序和特殊字符。

    阶段 3:表格解析器

    表格区域交给专门的表格解析模型,由它理解行列结构、合并单元格、多级表头以及跨页表格。

    阶段 4:图像分析器

    图形区域交给视觉模型,由它判定图形类型(图表、示意图、照片、图纸)并抽取其中相关的结构化信息。

    合并器

    合并器把各阶段的输出汇总成单一的结构化文档表示,解析交叉引用,并保持文档原有的逻辑结构。

    这四个阶段都能通过在领域数据上微调而变得更好。下面逐一说明各阶段的训练数据该怎么准备。

    布局检测器的数据准备

    你需要什么

    已标注的文档页面,页面上每个区域都框出边界框并归好类。这是一项目标检测标注任务,和在自然图像上训练 YOLO 所用的标注方式相同,只是对象换成了文档页面。

    标注流程

    第 1 步:挑选有代表性的页面。 不必把每份文档的每一页都标。挑出 200 到 500 页,覆盖管道将会遇到的各种版式。其中应包含:

    • 文字密集的页面(报告、叙述性内容)
    • 表格密集的页面(财务报表、工程量清单)
    • 混排页面(表格连带周围的正文和图注)
    • 图形页面(技术图纸、图表)
    • 复杂页面(多栏版式、侧边栏、嵌套元素)

    第 2 步:定义区域类别。 面向企业文档的一套实用类别:

    • text_block:连续的正文(段落、项目符号列表)
    • table:具有行列结构的表格数据
    • figure:图片、图表、图纸、示意图
    • header:页眉、章节标题
    • footer:页脚、脚注
    • caption:给图或表作说明的文字
    • page_number:页码
    • sidebar:侧栏或标注框中的内容
    • watermark:需要忽略的背景文字或图案

    先从较少的类别起步,只有当管道确实需要这层区分时才增加。对企业文档来说,九个类别通常够用。

    第 3 步:标注边界框。 逐页把每个区域框起来,并指定对应类别。使用支持边界框的标注工具(CVAT、LabelImg,或任何支持目标检测标注的平台)。

    几条关键的标注准则:

    • 框要贴紧,留白尽量少
    • 区域重叠时按最具体的类型标注(图注压在图形上时标成 caption,而非 figure
    • 多栏页面按栏分别标框
    • 跨页表格在每一页上各标一个框

    第 4 步:质量校验。 安排第二位标注员复核其中 20% 的标注。区域分类的标注员一致率应高于 90%,边界框坐标的偏差应控制在 5% 以内。

    规模要求

    针对自家文档类型微调的布局检测器:

    • 下限: 200 个标注页面,区域分类准确率可达 88% 到 92%。
    • 推荐: 500 个标注页面,准确率可达 93% 到 96%。
    • 理想: 1,000 页以上,在版式稳定的文档上准确率可达 96% 到 98%。

    如果文档使用统一模板(同一种报告格式、同一种发票版式),200 页往往就够。面对来源混杂的文档集合(多个供应商、多种格式),目标定在 500 页以上。

    文本提取器的数据准备

    你需要什么

    每个文本区域的标准答案文本:也就是本应从页面该区域提取出来的正确纯文本。

    制作标准答案

    数字版 PDF(带文本层): PDF 内嵌的文本可以直接充当标准答案,但要先校验。内嵌文本有时会有编码错误、阅读顺序错乱或字符缺失。

    做法是:用程序从 PDF 中抽取文本,人工抽查 50 到 100 个区域,修正其中成规律出现的提取错误。若内嵌文本稳定正确(字符准确率高于 98%),就直接用作标准答案;达不到这个水平,就得靠人工转录。

    扫描件(纯图像): 标准答案只能靠人工转录。这项工作很耗人力,但要在自家文档类型上训练出准确的 OCR 模型,就绕不开它。

    工时估算:人工转录一个文本区域视长度需要 1 到 3 分钟。500 个标注页面、每页平均 5 个文本区域,就是 2,500 个区域 × 2 分钟 ≈ 83 小时。分摊到一个小组身上,大约是 2 到 3 周的工作量。

    特殊字体或符号: 如果文档中出现领域专用符号(工程标注、数学公式、乐谱记号),务必确保它们在标准答案里被正确记录。通用 OCR 模型在这类符号上常常出错,而微调后的模型能学会它们,前提是标准答案里真的收录了这些符号。

    规模要求

    • 下限: 500 个带标准答案的文本区域
    • 推荐: 2,000 个文本区域
    • 理想: 5,000 个以上文本区域,以在多种字体和版式上取得最高准确率

    表格解析器的数据准备

    你需要什么

    每张表的结构化标准答案:正确的行列结构,连同单元格取值、合并单元格信息和表头关系。

    难点所在

    表格解析的标准答案是整条管道里最复杂的标注。单单一张表就要求:

    • 判定行数和列数
    • 把每个单元格的内容映射到它的行列位置
    • 标出合并单元格及其跨度(例如第 1 行中横跨第 2 到 4 列的单元格)
    • 区分表头行与数据行
    • 处理嵌套表头(多级列结构)
    • 串联跨页表格

    单条标注的工作量因此远高于文本转录或画边界框。

    标注流程

    第 1 步:梳理文档中的表格类型。 企业文档里常见的表格类型:

    • 简单表格(规整网格,无合并单元格)
    • 表头带合并单元格的表格
    • 行列表头嵌套的表格
    • 单元格内含多行文字的表格
    • 跨页表格
    • 带小计和总计的表格

    先把表格归类,这样才能确保各种类型都有覆盖。

    第 2 步:定义输出格式。 标准答案要用一种能完整表达表格各类关系的结构化格式。一个实用的格式:

    {
      "rows": 15,
      "columns": 5,
      "headers": [
        {"text": "Item", "row": 0, "col": 0, "rowspan": 1, "colspan": 1},
        {"text": "Description", "row": 0, "col": 1, "rowspan": 1, "colspan": 1},
        {"text": "Specifications", "row": 0, "col": 2, "rowspan": 1, "colspan": 3}
      ],
      "cells": [
        {"text": "1.01", "row": 1, "col": 0},
        {"text": "Concrete Grade 30", "row": 1, "col": 1},
        ...
      ]
    }

    第 3 步:标注表格。 逐张表产出结构化标准答案。可以用支持合并单元格和多级表头的表格标注工具,也可以导出到电子表格里人工整理结构。

    工时估算:简单表格每张 5 到 10 分钟;带合并单元格和嵌套表头的复杂表格每张 15 到 30 分钟。按这个量级排预算。

    第 4 步:校验。 做一次往返校验:把结构化标准答案重新渲染成可视表格,再与原表比对。出现差异就说明标注有误。

    规模要求

    由于结构上的复杂性,表格解析需要的训练数据比布局检测更多:

    • 下限: 300 张带标准答案的表格,足以应付简单表格结构。
    • 推荐: 1,000 张表格,可应付合并单元格和常规表头结构。
    • 理想: 2,000 张以上,可应付复杂的嵌套表头、跨页表格和不规则结构。

    第 1 步中梳理出的每种表格类型,至少要收进 50 个样例。

    图像分析器的数据准备

    你需要什么

    每个图形都需要两类标准答案:

    1. 分类: 这是哪种图形?(柱状图、折线图、流程示意图、技术图纸、照片、地图)
    2. 结构化抽取: 这个图形承载了哪些信息?

    分类标准答案

    把每个图形归入相应的子类。这是一项直白的图像分类任务,每个类别准备 20 到 50 个样例即可。

    企业文档中的典型类别:

    • 柱状图
    • 折线图
    • 饼图
    • 流程示意图
    • 组织架构图
    • 技术图纸
    • 平面图 / 总平面图
    • 照片
    • 徽标 / 装饰性图片

    抽取标准答案

    对承载数据的图形(图表和示意图),要制作结构化标准答案:

    图表: 抽取数据序列。一张展示季度营收的柱状图应产出:[{"quarter": "Q1", "revenue": 1200000}, {"quarter": "Q2", "revenue": 1450000}, ...]

    流程示意图: 抽取节点和连边。{"nodes": ["Start", "Review", "Approve", "Reject", "End"], "edges": [["Start", "Review"], ["Review", "Approve"], ["Review", "Reject"], ...]}

    技术图纸: 抽取关键尺寸、标签和注记。

    工时估算:图表数据抽取每张 3 到 5 分钟;示意图抽取视复杂度每张 5 到 15 分钟。

    规模要求

    • 分类: 每种图形类型 20 到 50 个样例(总计 150 到 400 个)
    • 图表数据抽取: 100 到 300 张带标准答案的图表
    • 示意图抽取: 50 到 200 张带标准答案的示意图

    图像分析所需的训练数据通常少于表格解析,因为预训练视觉模型本就理解图表和示意图的结构,微调补上的只是领域层面的校准。

    端到端质量校验

    各阶段的训练数据准备完毕后,要对整条管道做端到端校验:

    第 1 步: 把 50 份留出的文档完整跑一遍管道。

    第 2 步: 将管道输出的结构化结果与这些文档的人工标准答案逐项比对。

    第 3 步: 逐阶段度量准确率:

    • 布局检测:区域分类准确率与边界框 IoU
    • 文本提取:字符级准确率
    • 表格解析:单元格级准确率
    • 图像分析:分类准确率与抽取准确率

    第 4 步: 找出最弱的那个阶段。整条管道的准确率上限由最弱的阶段决定。若布局检测有 97%,而表格解析只有 82%,那么补强表格解析的训练数据回报最高。

    第 5 步: 迭代。给最弱阶段补充训练数据,重新训练,再评估,如此反复,直到所有阶段都达到你设定的准确率目标。

    时间线与资源投入

    以一条处理施工文档的典型企业管道为例:

    阶段标注量工时估算人员配置
    布局检测器500 页2 到 3 周1 到 2 名标注员
    文本提取器2,000 个区域2 到 3 周2 到 3 名标注员
    表格解析器1,000 张表格3 到 4 周2 名标注员加 1 名领域专家
    图像分析器300 个图形1 到 2 周1 名标注员加 1 名领域专家
    端到端校验50 份文档1 周1 名 ML 工程师加 1 名领域专家

    合计:3 到 4 人的团队需要 8 到 12 周。各阶段可以交叠推进:布局检测器的标注还在进行时,文本提取器的标注就能开工。

    Ertas Data Suite 支持多阶段管道的数据准备,为每个阶段提供对应的标注流程:布局检测用边界框标注,文本提取用文本转录,表格解析用结构化表格标注,图像分析用图形分类。平台还会维护各阶段之间的关联关系(哪些文本区域来自哪一页,哪些表格对应哪个边界框),从而提供合成解析管道所需的端到端可追溯性。


    延伸阅读

    就本文向 AI 提问

    Turn unstructured data into AI-ready datasets — without it leaving the building.

    On-premise data preparation with full audit trail. No data egress. No fragmented toolchains. EU AI Act Article 30 compliance built in.

    Keep reading