model sizeon-device AImobile AIGGUFarchitecture
裝置端 AI 模型大小指南:行動裝置的 1B vs 3B vs 7B
如何為你的行動應用程式選擇正確的模型大小。能力分解、裝置需求、品質基準,以及改變計算結果的微調因素。
Edward Xi Yang
為你的行動應用程式選擇正確的模型大小是裝置端 AI 中最關鍵的技術決策。太小則模型無法處理你的任務。太大則運行緩慢、使用過多記憶體,或排除太多裝置。
正確答案取決於你的任務、目標裝置,以及是否進行 微調。
大小範圍
| 參數量 | GGUF Q4 大小 | 所需 RAM | 裝置需求 |
|---|---|---|---|
| 1B | ~600MB | ~800MB | 4GB+ RAM(任何現代手機) |
| 3B | ~1.7GB | ~2.2GB | 6GB+ RAM(2023+ 中階) |
| 7B | ~4GB | ~5GB | 8GB+ RAM(僅旗艦) |
這些大小假設使用 Q4_K_M 量化,它提供了大小縮 減和品質保留之間的最佳平衡。更高的量化(Q5、Q8)增加 25-100% 的大小,但品質改善甚微。
每種大小能做什麼
1B 模型
優勢:
- 文字分類(情感、類別、意圖)
- 自動完成和文字預測
- 智慧建議(回覆建議、動作建議)
- 命名實體辨識
- 簡單問答搭配短回應
- 關鍵字擷取和標記
限制:
- 有限的推理能力
- 簡短、有時重複的生成
- 難以處理細緻的指令
- 無法維持連貫的長篇輸出
最適合: 將輸入轉換為結構化輸出的功能。分類、標記、建議和短篇生成。
3B 模型
優勢:
- 具有多輪連貫性的對話聊天
- 文章和文件摘要
- 內容草稿撰寫(電子郵件、訊息、筆記)
- 常見語言對之間的翻譯
- 複雜指令遵循
- 結構化輸出生成(JSON、格式化文字)
限制:
- 比 1B 慢(大約一半的速度)
- 無法匹配前沿模型的推理能力(GPT-4、Claude Sonnet)
- 沒有微調的情況下可能在高度技術性或專業內容上表現不佳
- 使用 2-3 倍於 1B 的記憶體
最適合: 生成人類可讀文字的功能。聊天、摘要、內容創作和複雜分類。
7B 模型
優勢:
- 更強的 推理和推論能力
- 在模糊或開放性任務上表現更好
- 更穩健的指令遵循
- 能處理更長、更連貫的輸出
限制:
- 只能在 8GB+ RAM 的旗艦裝置上運行
- 生成速度慢(大多數裝置上 5-12 tok/s)
- 排除了 50-70% 的裝置市場
- 記憶體壓力導致應用程式不穩定
最適合: 行動裝置上很少是正確的選擇。裝置覆蓋範圍和效能的權衡太嚴重。如果你需要 7B 品質,改為在你的領域資料上微調 3B 模型。
品質比較
通用基準(基礎模型,未微調)
| 任務 | 1B | 3B | 7B |
|---|---|---|---|
| 文字分類準確率 | 78-85% | 85-90% | 88-93% |
| 摘要品質(人工評估) | 5.5/10 | 7/10 | 8/10 |
| 指令遵循率 | 70% | 85% | 90% |
| 對話連貫性(5 輪) | 差 | 良好 | 非常好 |
| JSON 輸出可靠性 | 60% | 82% | 90% |