agencyoperationsmulti-tenantfine-tuningscaling
為不同客戶運行 10 個以上微調模型:運營指南
AI 機構管理多個客戶的 10 個以上微調模型的運營指南——涵蓋模型組織、資源分配、監控、更新和不混亂地擴展。
Edward Xi Yang
在三個客戶時,你可以把一切都記在腦子裡。在五個客戶時,試算表就足夠了。在十個客戶時,某些事情就會出問題——模型被部署到錯誤的客戶,更新覆蓋了生產適配器,或者你意識到你完全不知道哪個 GPU 在運行什麼。
這是 AI 機構的多模型現實。讓你走到這一步的工作——客製化微調、親身部署、個人關注——除非你在其周圍建立系統,否則無法擴展。本指南是在多個客戶之間運行 10 個以上微調模型而不失去理智或利潤率的運營手冊。
多模型現實
大多數機構在 5 到 10 個活躍客戶模型之間的某個地方碰壁。症狀是可預測的:
- 你記不清哪個版本的哪個適配器部署在哪裡
- 兩個團隊成員在同一天用不同資料重新訓練同一個模型
- 客戶報告效能下降,你花 2 小時弄清楚發生了什麼變化
- 你的 GPU 費用比收入增長得更快,因為沒有什麼被有效地共享
根本原因始終是相同的:在小規模時有效的臨時管理,在接觸到真實容量時就難以為繼。你需要系統。
模型組織系統
基礎是一個命名慣例,它一眼就能編碼你需要知道的一切。我們推薦這種格式:
{client}-{task}-{base}-v{major}.{minor}.{patch}
例如:
acme-support-llama3-v2.1.0— Acme Corp 的支援票模型,基於 Llama 3,第二個主要版本baker-legal-mistral-v1.3.2— Baker Law 的法律審查模型,基於 Mistral,應用了三個修補程式
這個命名慣例貫穿所有地方:你的檔案系統、你的部署配置、你的監控儀表板和你的客戶溝通。
LoRA 適配器庫
如果你每個客戶都在 運行一個完整的基礎模型,你做錯了。LoRA 適配器是多客戶 AI 機構可行的全部原因。
按如下方式組織你的適配器庫:
models/
├── base/
│ ├── llama3-8b/
│ └── mistral-7b/
├── adapters/
│ ├── acme/
│ │ ├── support-v2.1.0/
│ │ └── support-v2.0.0/ (先前版本,保留用於回滾)
│ ├── baker/
│ │ ├── legal-v1.3.2/
│ │ └── legal-v1.3.1/
│ └── ...
└── configs/
├── acme-support.yaml
└── baker-legal.yaml
每個適配器目錄包含 LoRA 權重、產生它們的訓練配置、訓練資料的雜湊值和評估結果。重現或回滾所需的一切。