unstructured-dataenterprise-aidata-preparationdocument-ai
企業 80% 的資料是非結構化的:接下來怎麼做
企業約 80% 的資料是非結構化的,20% 是結構化的。這 80% 裡有什麼、為什麼 AI 專案會卡在這一步,以及該先從哪裡做起。
Edward Xi Yang
這個統計數據隨處可見:80-90% 的企業資料是非結構化的。IBM、MIT、Gartner 和數十位分析師在過去十年中都引用過它。它已經成為背景——一個如此熟悉的事實,以至於沒有人停下來思考它實際上意味著什麼。
對於採用 AI 的企業而言,其影響是具體且深遠的。那 80% 代表了大多數組織中最大的未開發訓練資料來源——也是 AI 專案在資料階段停滯的 主要原因。
「非結構化」到底是什麼意思
非結構化資料是無法放入行和列的資訊。它沒有預定義的 schema、沒有一致的格式,也沒有簡單的方法用 SQL 查詢。
實際而言,這是企業擁有的:
文件(最大類別)
- PDF:合約、報告、規範、手冊、通信——商業文件的預設格式。有些是數位原生的(可搜尋文字)。許多是紙張的掃描影像(需要 OCR)。
- Word 文件:提案、備忘錄、會議記錄、政策——通常在部門和年份之間格式不一致。
- 含敘述性內容的試算表:真正的資訊在評論、合併儲存格和自由文字欄位中的 Excel 檔案——而非結構化的數值資料。
通訊
- 電子郵件:企業員工平均每天發送超過 40 封郵件。多年的郵件檔案包含客戶需求、決策、核准、投訴和機構知識。
- 聊天記錄:Slack、Teams 和其他通訊平台的檔案。越來越多的決策在這裡做出,知識在這裡分享。
- 會議錄音和逐字稿:品質各異的影片和音訊錄製及轉錄。
技術和領域特定
- 工程圖面:CAD 匯出、藍圖、線路圖——視覺格式的空間資訊。
- 醫療記錄:臨床筆記、出院摘要、放射科報告——結構化代碼旁的自由文字臨床文件。
- 法律文件:合約、摘要、法院文件、監管提交——密集的、領域特定的文字。
媒體
- 影像:產品照片、檢查影像、衛星影像、掃描文件。
- 音訊/影片:客服電話、訓練影片、監控錄影。
這對 AI 意味著什麼
訓練資料缺口
AI 模型從資料中學習。企業 20% 的結構化資料(資料庫、ERP 記錄、CRM 欄位)已經在使用中——它驅動著儀表板、報表和傳統分析。80% 的非結構化資料基本上未被觸及。
這造成了訓練資料缺口:企業擁有的最具領域特定性、最富上下文的資料,正是它無法輕易用於 AI 的資料。
律師事務所對法律 AI 最有價值的資產不是案件編號資料庫——而是包含事務所法律推理的合約、摘要和備忘錄。醫院對臨床 AI 最有價值的資產不是計費代碼——而是描述患者表現、診斷推理和治療決策的臨床筆記。