data-lineagecomplianceeu-ai-actenterprise-aiaudit-trail
什麼是資料血緣——以及為何企業 AI 團隊在 2026 年無法忽視它
資料血緣追蹤訓練資料的來源及其轉換方式。在 2026 年,它是 EU AI Act 第 10 條和 HIPAA 下的合規要求——而大多數企業管線完全沒有這個。
Edward Xi Yang
資料血緣是追蹤訓練資料集中任何記錄的能力——通過每次轉換、刪減和標注決策——一直追溯到其來源文件,每一步都有時間戳和操作員身份。
大多數企業 AI 管線完全沒有這個 。資料通過一系列腳本和工具處理,每個工具產生輸出文件後傳送到下一步。到訓練範例到達 JSONL 匯出時,產生它的決策鏈已無法恢復。沒有記錄顯示它來自哪個來源文件、誰清洗了它、什麼被刪減了、誰標注了它,或這些事情發生的時間。
2025 年,這是技術債問題。2026 年,隨著 EU AI Act 第 10 條完全適用,且 HIPAA 執法日益關注 AI 系統,這已成為合規缺口。
資料血緣在實踐中意味著什麼
資料血緣不是關於資料目錄或資料庫架構追蹤——儘管這些概念使用相同的術語。在 AI 訓練資料的背景下,血緣具體意味著:
來源溯源:每條訓練記錄都可以追溯到特定的來源文件(最理想的是追溯到該文件中的特定頁面、章節或段落)。
轉換歷史:對來源內容的每次修改——OCR 校正、個人識別資訊刪減、文字標準化、去重刪除——都記錄了:轉換是什麼、誰或什麼系統應用了它,以及何時應用的。
標注溯源:每個標籤——實體標記、分類標籤、邊界框——都記錄了標注員的身份和時間戳。