微調品質檢查清單:部署到客戶前的 10 項測試
代理商和團隊在將微調模型部署到客戶前的 10 點品質檢查清單——涵蓋準確率基準測試、幻覺偵測、格式合規性、延遲和安全防護。
你訓練了一個模型。指標看起來不錯。客戶演示進展順利。現在你的團隊中有人問了這個將專業代理商與業餘愛好者區分開來的問題:「我們真的準備好發布這個了嗎?」
大多數代理商無法自信地回答這個問題。他們有直覺——「測試中看 起來不錯」——但沒有系統化流程。這份清單解決了這個問題。十個具體測試,每個都有明確的通過/失敗標準,在每次客戶部署之前運行。
把這份清單打印出來。把它放在你的項目模板中。不要因為時間緊迫就跳過步驟。這份清單需要 2-3 小時,將讓你免於在糟糕部署之後的 20-30 小時緊急調試和客戶危機管理。
測試 1:黃金測試集準確率
要檢查什麼: 通過微調模型運行你的黃金測試集(50-100 個從未用於訓練的具有已知正確輸出的範例)。計算準確率。
如何檢查: 準備一個帶有輸入-輸出對的 JSONL 文件。通過模型運行每個輸入。對於分類任務,檢查精確匹配。對於生成任務,讓領域專家將每個輸出評為正確、部分正確或錯誤。
通過標準:
- 分類任務:92% 以上準確率
- 生成任務:85% 以上評為正確,低於 5% 評為錯誤
- 沒有單個錯誤類別佔總測試案例的 3% 以上
失敗措施: 如果準確率低於閾值,找出錯誤模式。 通常修復方法是添加 50-100 個針對失敗案例的有針對性訓練範例並重新訓練。不要發布並希望它能自行解決。
測試 2:幻覺率
要檢查什麼: 模型生成聽起來合理但事實上不正確的資訊的頻率?這對法律、醫療和財務使用案例尤其關鍵。
如何檢查: 選擇 30 個測試輸入,其中正確答案涉及具體事實——姓名、日期、數字、引用、產品詳細資訊。通過模型運行它們。根據你的源材料驗證每個輸出中的每個事實聲明。
通過標準:
- 高風險領域(法律、醫療、財務)零幻覺事實
- 一般商業使用案例幻覺率低於 3%
- 當模型沒有資訊時,它應該表達不確定性而不是捏造
失敗措施: 幻覺通常意味著訓練資料太小或模型在模式上過擬合而不是學習事實。請參閱我們的微調模型幻覺指南了解具體的緩解策略。考慮添加 RAG 層進行事實基礎。
測試 3:格式合規性
要檢查什麼: 模型是否始終以客戶應用程式期望的精確格式生成輸出?以錯誤格式生成完美內容的模型將破壞每個下游整合。
如何檢查: 運行 50 個測試輸入,並以程式方式根據你的格式規格驗證每個輸出。如果輸出應該是 JSON,則解析它。如果它應該遵循帶有特定部分的模板,則檢查每個部分。如果它應該保持在字數限制下,則計算字數。
通過標準:
- 98% 以上格式合規率
- 零輸出會導致下游解析錯誤
- 格式邊緣案例的一致處理(空字段、特殊字符、Unicode)
失敗措施: 格式問題是最容易修復的。添加 20-30 個具有正確格式的範例並重新訓練。如果模型在 JSON 輸出上不一致,在系統提示中添加明確的格式指令作為雙重保障。