歐盟 AI 法案第 10 條:訓練資料要求
第 10 條對高風險 AI 訓練資料提出了哪些要求:四項品質標準、偏見審查、可追溯的稽核記錄,以及附件四所要求的技術文件,合規截止日期為 2026 年 8 月 2 日。
當 EU AI Act 於 2024 年 8 月生效時,大多數評論集中在禁止的 AI 實踐(第 5 條)和高風險系統要求(附件 III)上。對第 10 條——管理用於構建高風險 AI 系統的資料的條款——關注較少。這是個問題,因為第 10 條對你的訓練資料、驗證資料和測試資料施加了具體且可執行的要求——大多數企業 AI 團隊目前未能滿足這些要求。
高風險 AI 系統的完整適用截止日期是 2026 年 8 月 2 日。如果你在任何涵蓋領域構建 AI,你只有有限的時間窗口讓你的資料治理實踐達到合規。
哪些系統受第 10 條約束?
第 10 條適用於附件 III 定義的「高風險 AI 系統」提供商。清單包括用於以下領域的 AI:
- 關鍵基礎設施(公用事業、交通、供水)
- 教育和職業培訓(教育獲取、績效評估)
- 就業和人力資源(招聘、晉升、工作管理、解僱)
- 基本服務(信用評分、保險風險、緊急服務調度)
- 執法(風險評估、測謊、證據可靠性)
- 移民和邊境管控(風險評估、文件驗證)
- 司法行政(協助法院的 AI)
- 醫療設備(根據歐盟 MDR 分類為醫療設備的 AI)
如果你的組織在這些領域中的任何一個開發或部署 AI 並將其投放歐盟市場,第 10 條就適用。請注意,「提供商」包括內部開發團隊——你不需要商業銷售 AI 才能成為法案下的提供商。
對於不確定其系統是否符合條件的組織,歐盟委員會已發布指引,但最安全的方法是,如果你的 AI 對人做出或協助做出具有重大影響的決定,就假定高風險分類適用。
第 10 條實際要求什麼
第 10 條標題為「資料和資料治理」。其要求涵蓋整個資料管道,而非只是最終的訓練集。
第 1 款:資料管理實踐
提供商必須實施涵蓋以下方面的資料治理和管理實踐:
- 關於資料的設計選擇(納入什麼以及原因)
- 資料收集流程
- 相關資料準備處理操作(清理、標記、豐富、聚合、標注)
- 資料如何與 AI 系統的預期目的相符
這不是事後補充文件的要求。實踐必須在開發過程中就位,這意味著你目前的資料準備工作流程已在範圍之內。
第 2 款:資料品質標準
訓練、驗證和測試資料集必須符合四個標準:
- 相關 — 資料必須與 AI 系統的預期目的相關
- 代表性 — 資料必須充分代表系統將在其中運行的條件
- 無錯誤 — 在可能的範圍內;這需要主動的品質評估,而非只是假設
- 完整 — 就目的所需的特徵或屬性而言
「在可能的範圍內」關於錯誤的措辭是有意義的——它承認完美的資料不存在。但它也意味著你需要證明你已主動檢查並解決了資料品質問題,而不只是忽略它們。
第 3 款:偏差檢查
必須對資料集進行可能偏差的檢查,這些偏差可能影響 AI 系統的輸出並導致健康、安全或基本權利的風險。如果發現偏差,必須加以處理——或者如果無法完全處理,殘餘偏差必須記錄文件並通過其他手段緩解。
這需要一個刻意的檢查流程,而非只是對你的資料無偏差的一般假設。檢查方法論和結果必須記錄文件。
第 4 款:敏感資料
在必要時用於偵測和糾正偏差的情況下,第 10 條第 4 款允許收集和處理敏感類別的個人資料(GDPR 第 9 條資料:種族、健康、政治觀點等)——受嚴格條件約束,包括適當的保障措施和目的限制。
這一規定常被誤讀為廣泛允許敏感資料使用。它並非如此。它提供了一個狹窄的例外,專門用於偏差檢測,並附帶相應義務。
第 5 款:與操作環境的相關性
代表性要求延伸到 AI 實際運行的特定地理、行為和功能環境。訓練資料必須反映部署的實際條件——而非只是實驗室或理想條件。