能源與公用事業預測性維護:建構AI就緒的資料管道
為能源和公用事業預測性維護AI準備SCADA資料、設備日誌和維護記錄的實用手冊。涵蓋資料管道階段、天氣關聯以及關鍵基礎設施的本地架構。
計畫外變壓器故障在考慮緊急維修、監管罰款和收入損失後,每次事故給公用事業公司造成100萬至1000萬美元的損失。預測性維護AI可以在故障發生前數週發現退化模式——但前提是為這些模型提供資料的管道必須正確建構。
挑戰不在於AI模型本身。而在於上游資料準備:清洗數十年不一致的SCADA讀數,標準化由不同團隊以不同格式撰寫的維護日誌,以及將設備感測器資料與影響故障率的天氣模式進行關聯。
本手冊涵蓋能源和公用事業預測性維護AI的端到端資料管道,從原始資料來源到AI就緒輸出。
能源領域的資料來源
能源和公用事業中的預測性維護依賴五大資料類別,每類都有不同的格式和品質挑戰。
| 資料來源 | 典型格式 | 資料量 | 品質挑戰 |
|---|---|---|---|
| SCADA遙測 | 時間序列CSV、OPC-UA匯出 | 每個變電站10-50 GB/月 | 讀數缺失、感測器漂移、時間戳錯位 |
| 維護日誌 | 自由文字、PDF工單、試算表 | 每個設施500 MB - 5 GB/年 | 術語不一致、手寫記錄、重複記錄 |
| 設備登記 | 關聯式資料庫匯出、Excel | 每個公用事業公司50-200 MB | 過時記錄、跨系統資產ID不一致 |
| 天氣資料 | CSV、API回應 (NOAA, ECMWF) | 每個服務區域1-2 GB/年 | 空間解析度缺口、缺失站點 |
| 檢查報告 | PDF、Word文件、圖片 | 每個設施2-10 GB/年 | 非結構化敘述、嵌入圖片、評級不一致 |
任何管道的第一步是將這些資料來源對映到統一的擷取策略。
管道架構:六個階段
資料管道遵循六個階段,每個階段產生可觀察的中間輸出,能源工程師可以在資料進入下游之前進行驗證。
階段1:擷取
原始資料以混合格式到達。SCADA匯出以CSV時間序列形式出現,維護日誌為PDF和Word文件,設備登記為資料庫匯出,檢查報告為帶有嵌入圖片的掃描PDF。
在Ertas中,擷取階段使用特定格式的解析節點:PDF Parser用於檢查報告和工單,Excel/CSV Parser用於SCADA匯出和設備登記,Word Parser用於敘述性維護日誌,Image Parser用於掃描文件。每個解析器在保留來源檔案中繼資料、時間戳和來源系統資訊的同時擷取結構化內容。
關鍵考量:SCADA資料通常以OPC-UA歷史資料庫匯出形式到達。在擷取前將其轉換為扁平CSV,保留原始時間戳精度(通常為毫秒或亞毫秒級)。
階段2:清洗
能源領域資料有通用工具無法涵蓋的特定清洗需求。
跨系統去重。 維護事件經常同時出現在CMMS(電腦化維護管理系統)和SCADA告警日誌中。變壓器油溫告警和由此產生的工單描述的是同一事件,但格式完全不同。Deduplicator節點使用可設定的配對規則識別這些跨系統重複——時間戳接近度加資產ID重疊。
感測器漂移校正。 SCADA讀數隨感測器老化而漂移。Anomaly Detector節點根據歷史基線標記偏離預期範圍的讀數,允許工程師將其標記為排除或手動更正,以防它們污染訓練資料。
術語標準化。 維護團隊使用不一致的語言:"xfmr"、"transformer"、"TX"和"power transformer"都指同一類設備。Format Normalizer節點套用領域特定的對映,在所有文字欄位中標準化術語。
階段3:轉換
此階段將清洗後的資料轉換為適合預測性維護模型的結構。
時間序列對齊。 SCADA資料、天氣資料和維護事件在不同的時間尺度上運作。感測器讀數每5秒到達,天氣資料每小時,維護事件則是不規則的。管道必須將這些對 齊到一個共同的時間視窗——通常是每小時或每日聚合——並附上適當的統計摘要(連續讀數的均值、最大值、最小值、標準差;事件資料的計數和時近性)。
故障預測的特徵工程。 最有效的預測性維護特徵組合了多個資料流:
| 特徵 | 資料來源 | 計算方法 |
|---|---|---|
| 溫度變化率 | SCADA熱感測器 | 油溫/繞組溫度的24小時滾動斜率 |
| 負載調整熱指數 | SCADA負載 + 溫度 | 在目前負載下溫度與預期值的偏差 |
| 維護時近性評分 | 工單、CMMS | 距上次預防性維護的天數,按維護類型加權 |
| 天氣壓力因子 |