每用戶 LoRA 適配器:大規模個人化 AI
LoRA 適配器每個僅 50-200MB。單一基礎模型即可依請求熱切換個人化適配器,不會讓推理成本倍增。
每位用戶都希望 AI 能理解他們的情境:他們的術語、偏好、領域特點、溝通風格。一個熟悉其產品的支援客服助理。一個符合其寫作風格的寫作助手。一個了解其資料結構的分析師。
目前個人化的方案各有問題:
每用戶系統提示: 將用戶情境塞入冗長的系統提示中。對於輕度個人化有效,但每次請求都要 為這些情境 Token 付費。在 GPT-4o 上,一個 2,000 Token 的系統提示每次請求花費 $0.005——乘以每用戶每月 1,000 次請求、500 位用戶,光是系統提示 Token 就要花費 $2,500/月。此外,系統提示有字數限制,2,000 個 Token 無法編碼深層行為模式。
每用戶 RAG: 為每位用戶維護獨立的知識庫,在推理時擷取相關情境。對於事實性個人化效果更好,但仍需按 Token 付費擷取的內容。再加上運營開銷:每位用戶需要獨立的向量資料庫、嵌入管道、擷取品質監控。對於 1,000 位用戶,就意味著需要維護 1,000 個向量資料庫。
每用戶完整微調: 為每位用戶完整微調一個模型。個人化程度深,但實際上完全不可行。一個 7B 模型量化後約 4GB。1,000 位用戶意味著 4TB 的模型儲存空間和 1,000 個獨立模型實例需要管理。
LoRA 適配器優雅地解決了這個問題。
LoRA 個人化架構
一個基礎模型常駐記憶體。每用戶 LoRA 適配器存放在磁碟上。當用戶發出請求時,載入對應的適配器。提供回應。卸載適配器。準備好接受下一位用戶的請求。
讓這一切得以運作的數字:
- 基礎模型(Llama 3.1 8B,Q4):GPU 記憶體中佔 4GB
- 每用戶 LoRA 適配器:磁碟上佔 50-200MB
- 適配器載入時間:50-200ms(從 SSD)
- 1,000 位用戶 × 平均 100MB 適配器:總儲存空間 100GB
- 100GB SSD 儲存費用:雲端每月約 $8
相比之下,1,000 份完整模型副本共 4TB,或 1,000 個獨立 RAG 管道。經濟效益根本不在同一個量級。
熱切換的運作方式
每用戶適配器架構的推理流程:
- 請求到達,帶有用戶 ID
- 檢查用戶適配器是否已載入記憶體
- 若未載入:從磁碟載入適配器(50-200ms)
- 將適配器權重與基礎模型合併
- 執行推理
- 回傳回應
- 將適配器保留在記憶體快取中(非活躍用戶以 LRU 演算法淘汰)