Back to blog
    eu-ai-actcompliancedeadlinesprintdata-pipeline

    距 EU AI Act 合规还有5个月:数据管道实施冲刺

    2026年8月2日。这是 EU AI Act 高风险系统合规的截止日期。如果你的 AI 数据管道今天没有审计追踪和文档,这里是5个月的冲刺计划。

    Edward Xi Yang

    2026年8月2日。这是 EU AI Act 高风险 AI 系统执行条款全面适用的日期。8月3日,监管机构可以要求合规证据。如果你无法提供,罚款起步750万欧元或全球营业额的1.5%,最高可达3500万欧元或全球营业额的7%。

    今天是2026年3月15日。你还有140天。

    如果你的 AI 数据管道已经能产出带时间戳的审计追踪、操作员身份标识、数据血缘追踪,以及符合第10条和第11条要求的文档,那么情况尚可。验证它确实跑得通,做一次模拟审计,然后继续手头的工作。

    如果没有,如果训练数据摊在共享云盘上,数据转换记在电子表格里(或者根本没记),文档只剩下去年 AI 治理会议上的几张幻灯片,那这篇文章就是写给你的。以下是这5个月的冲刺计划。

    谁受影响

    EU AI Act 按风险等级对 AI 系统分类。2026年8月2日这个期限针对的是高风险系统,也就是法规附件 III 列出的那些。只要你的组织在下面任何一个领域部署了 AI,数据管道就需要配套的合规基础设施:

    • 就业与劳动力管理:筛选简历、评估候选人、决定晋升、分配任务、监控绩效或影响解雇决定的 AI 系统。
    • 信贷与保险:评估信用状况、厘定保费或为金融产品评估风险的 AI 系统。
    • 教育:评估学生、决定录取或分配教育资源的 AI 系统。
    • 执法:评估证据可靠性、进行风险评估、对个人做画像或判断证词可信度的 AI 系统。
    • 关键基础设施:管理供水、燃气、电力、供热或数字基础设施中安全组件的 AI 系统。
    • 移民与边境管理:评估风险、核验证件真伪或处理申请的 AI 系统。
    • 司法与民主程序:协助司法机关查明事实、适用法律或解决争议的 AI 系统。

    只要你的 AI 系统落入附件 III 的任一类别,并且处理欧盟居民的数据,就在监管范围之内。"我们总部不在欧盟"这一条挡不住:法规的适用依据是受影响的个人身在何处,而非公司注册在哪里。

    审计人员会查什么

    对多数附件 III 高风险系统,法规给出的合格评定路径是附件 VI 的内部控制,提供者确实是自我评估。审计人员不接受的,是背后什么都拿不出来的自我评估。审计人员要的是运营证据:机器可读、带时间戳、可核验的记录,用来证明合规是持续发生的日常,而非一次性的文档突击。

    具体来说,他们会检查这几件事:

    数据血缘:任何一次模型输出,你能追溯到产生它的那批具体训练数据吗?"我们用了一个5万条记录的数据集"这种说法达不到要求。审计人员想看到的是:"该模型训练自数据集版本4.2.1,这一版由某位操作员在某个日期,对某几份具体源文档施加某几项具体转换后生成。"

    转换日志:施加在训练数据上的每一项操作,包括过滤、清洗、标注、增强、去重,都必须连同时间戳、操作员 ID、所用参数和受影响的记录数一并落盘。"我们清洗了数据"这样一句话算不上日志条目。

    质量文档:管道每个阶段的数据质量评估证据。测量了哪些指标?设了什么阈值?没通过质量检查的数据后来怎么处理了?

    可重现性:任一已部署的模型版本,你能重建出训练它时用的那个数据集吗?如果审计人员 A 索要2026年1月部署的模型 v3.2 所用的数据集,你能逐位重新生成吗?

    偏差与公平性文档:证明你检查过训练数据中的偏差、记录了发现、并采取了修复措施。标准落在"检查过、记录过、处理过"这三件事上,审计人员并不期待数据里完全没有偏差。

    5个月冲刺计划

    第1个月(3月15日至4月15日):审计与分类

    第1至2周:盘点所有 AI 系统。把生产环境和开发中的每一个 AI 系统都列出来。对每个系统确认:

    • 它是否落入附件 III?(拿不准就按"是"处理。)
    • 它使用哪些训练数据?
    • 训练数据存放在哪里?
    • 是谁准备的训练数据?
    • 施加过哪些转换?
    • 现有任何文档吗?

    第3至4周:差距分析。对每个在范围内的系统,逐项对照要求评估现状:

    • 数据血缘:你知道训练数据从哪来吗?(评分:0 = 毫无头绪,1 = 大致知道,2 = 来源有文档记录,3 = 完整可追溯)
    • 转换日志:转换有没有记录?(评分:0 = 没有,1 = 人工记录,2 = 部分自动化,3 = 完全自动化)
    • 质量文档:质量指标有没有留存?(评分:0 至 3)
    • 可重现性:能否重建过去的数据集?(评分:0 至 3)
    • 偏差检查:偏差评估做过吗?(评分:0 至 3)

    任何一项低于2分的系统都需要修复。多数企业会发现,自家70%至80%的 AI 系统至少在一个类别上低于2分。

    交付物:一份排好优先级的修复计划,为第2到第5个月列明具体任务、负责人和期限。

    第2个月(4月15日至5月15日):实施自动化日志

    这是地基。没有自动化日志,其余一切都只是事后补写的文档,而这类文档正是审计人员会挑出来的。

    为每一次数据转换实施带时间戳的日志。每当数据被过滤、清洗、标注、增强、去重或导出,系统都应自动记录:

    • 时间戳(取自可信时间源,而非本地系统时钟)
    • 操作员 ID(谁发起了这次操作)
    • 操作类型(做了什么)
    • 参数(用的什么设置)
    • 输入记录数与输出记录数
    • 受影响的记录(数据集较大时可用样本哈希代替)

    技术实现路径

    • 管道跑在 Python 脚本里:加上结构化日志(JSON 格式),并接入集中式日志聚合服务
    • 管道用了工作流编排器(Airflow、Prefect):开启编排器自带的审计日志,再在每个任务内部补上数据层面的日志
    • 管道用的是 Ertas Data Suite:日志功能内置,默认即合规,每一次操作都会连同操作员 ID、时间戳和完整参数一起记录

    交付物:在范围内的每一条管道、每一次数据转换,都产出一条机器可读的日志条目。跑一次测试转换、确认日志输出,即可验证。

    第3个月(5月15日至6月15日):构建数据血缘追踪

    日志告诉你发生过什么。血缘告诉你链条:任何一个输出如何经由每一个中间步骤连回它的源头。

    实施数据集版本管理。每个数据集版本获得一个唯一标识,其中编码了它的完整历史:源数据版本 + 转换序列 + 时间戳。当你为模型训练导出数据集时,这个版本 ID 本身就是一份完整的来源记录。

    把模型版本与数据集版本关联起来。模型训练时记下用的是哪个数据集版本,这样就形成一条链:模型输出 → 模型版本 → 数据集版本 → 转换历史 → 源数据。

    端到端测试这条链。挑一个生产模型,看能否把它的训练数据一路追溯到最初的源文档。链条在哪里断了,就在哪里补上。

    交付物:对任何一个已部署的模型,你都能在30分钟内出具一份血缘报告,完整呈现从源数据到已部署模型的整条链。

    第4个月(6月15日至7月15日):编写文档

    日志和血缘就位之后,开始搭建审计人员会审阅的那套文档。

    第10条文档

    • 数据治理政策(谁对训练数据质量负责)
    • 数据集设计选择(为什么选这批数据,考虑过哪些替代方案)
    • 数据收集过程(来源、日期、同意状态)
    • 准备操作(清洗、标注、增强,现在有自动化日志作为支撑)
    • 质量评估(统计特性、覆盖度分析、适用性评估)
    • 偏差检查(所用方法、发现、修复措施)
    • 缺口识别(缺哪些数据,打算怎么补)

    第11条文档(内容由附件 IV 规定):

    • AI 系统的技术文档
    • 数据管道说明
    • 质量管理程序(第17条)
    • 记录留存系统说明(第12条)

    把这些文档做成模板。管道每变更一次它们就得更新,所以要做成活文档,让其中一部分章节自动从你的日志和血缘系统取数。

    交付物:为每一个在范围内的 AI 系统备齐第10条和第11条文档包。

    第5个月(7月15日至8月2日):测试与验证

    做一次模拟审计。找一支内部团队(或外部顾问)扮演审计人员,给他们真实审计会用到的同一套接口,让他们:

    • 索要某个具体模型的训练数据血缘
    • 要求查看某个日期区间的转换日志
    • 索要偏差检查的证据
    • 要求重现某个历史数据集版本
    • 尝试修改一条日志条目(这应当无法做到)

    模拟审计暴露的每个缺口都要补上。你有18天。按严重程度排序:血缘缺失 > 日志缺失 > 文档不完整 > 格式问题。

    验证不可篡改性。确认日志条目一经创建就无法修改或删除。这是常见的失败点:日志写进普通数据库又没有写保护的系统,允许事后改动,审计追踪的效力也就被架空了。

    交付物:一份全部通过的模拟审计报告,或者一份显示所有缺口均已关闭的修复记录。

    常见陷阱

    文件不带版本的共享云盘。如果训练数据放在文件可被直接覆盖、没有版本历史的共享云盘上,血缘和可重现性都无从证明。立刻迁移到带版本管理的存储。

    人工日志。"我们用一张电子表格记录所有数据处理步骤。"电子表格可以事后编辑,没有可保证的时间戳,还得靠人自觉才能保持更新。这类记录构不成合规证据。

    没有操作员追踪。如果管道以一个共享的服务账号运行,你无法指认每次操作究竟是谁执行的。请为每位操作员实施独立的身份认证。

    用截图当证据。截图可以伪造,审计人员清楚这一点。行业标准是带密码学完整性校验的机器可读日志。

    事后补文档。2026年7月才动笔写管道文档、再把日期往前倒填,产出的证据一眼就能看出是7月才开始的。审计人员会注意到。现在就开始,你的文档才有真实的历史纵深。

    不合规的代价

    EU AI Act 的罚则结构在设计上讲究相称,也确实够疼:

    • 最严重的违规(被禁止的 AI 行为):最高3500万欧元或全球年营业额的7%,以较高者为准。
    • 高风险系统违规(含数据治理不到位):最高1500万欧元或全球年营业额的3%。
    • 文档违规(向主管机关提供不正确或缺失的信息):最高750万欧元或全球年营业额的1%,以较高者为准(对中小企业和初创企业,第99(6)条规定以较低者为准)。

    对一家年营收5亿欧元的公司来说,仅一项文档违规就可能意味着750万欧元的罚款,而数据治理违规可以达到1500万欧元。

    罚款之外,不合规的 AI 系统还可能被勒令撤出欧盟市场。对于依靠 AI 驱动的服务面向欧盟客户的公司,这是关乎存续的运营风险。

    本周就动手

    上面这份冲刺计划节奏很紧,但对现在就投入资源的组织来说做得到。最大的风险来自拖延,而非技术复杂度。每拖一周,剩下的时间就被压缩一分,抵达8月2日时仍带着缺口的风险也就高一分。

    如果你在3月15日读到这篇文章而还没启动,第一个动作应该是在接下来10个工作日内完成盘点和差距分析(第1个月第1至2周)。其余每一步,都建立在"知道自己手上有什么、又缺什么"之上。

    延伸阅读

    就本文向 AI 提问

    Turn unstructured data into AI-ready datasets — without it leaving the building.

    On-premise data preparation with full audit trail. No data egress. No fragmented toolchains. EU AI Act Article 30 compliance built in.

    Keep reading