synthetic-datadata-augmentationair-gappedfine-tuninglocal-llmon-premise
空氣隔離環境中的微調合成資料生成
如何在空氣隔離環境中生成合成訓練資料——涵蓋改述、指令生成、DPO 配對,以及僅使用本地 LLM 進行種子擴展。
Edward Xi Yang
企業資料集規模很小。不是「我們希望有更多」的小,而是結構性的小。一家醫院可能有 1,500 份相關的放射科報告。 一家律師事務所可能有 800 份所需特定類型的合約。一家銀行可能有 3,000 份適合分類任務的交易敘述。
對於微調而言,這往往不夠。根據任務複雜度,大多數微調方法在 5,000–50,000 個訓練樣本時效果更好。當真實資料稀缺時,合成資料生成填補了這一空缺——使用模型創建額外的訓練樣本,以擴大覆蓋範圍、平衡類別分布並引入變化。
在不允許任何網路流量的空氣隔離環境中,所有生成必須使用本地模型。本指南涵蓋實際技術、工作流程和限制。
為何合成資料對服務提供者很重要
向企業客戶提供微調服務的服務提供者,幾乎在每個專案中都面臨資料量不足的問題。企業客戶有足夠的資料來展示任務,但很少有足夠的資料進行穩健的模型訓練。
選擇如下:
- 用現有資料訓練 — 對資料量大的簡單任務有效。當資料稀缺時,產生脆弱的模型。
- 收集更多真實資料 — 理想但緩慢。需要客戶可能沒有的領域專家時間。可能需要數月才能積累足夠的資料。