slmsmall-language-modelsenterprise-aion-premisefine-tuning
企業小型語言模型:本地微調的優勢
為什麼企業正在從大型基礎模型轉向在本地運行的微調小型語言模型。成本、延遲、數據主權和使其奏效的微調工作流程。
Edward Xi Yang
企業 AI 採用中正在發生一場悄然的糾正。在兩年的爭相整合最大、最有能力的可用基礎模型之後,工程團隊正在發現,對於其大多數生產工作負載,他們不需要通過雲端 API 訪問的 4000 億參數模型。他們需要一個 70 億參數的模型,在他們自己的數據上微調,在他們自己的硬件上運行。
這不是退步。這是任何技術的自然成熟:最初的「把計算力扔到所有問題上」階段讓位於優化、專業化和成本紀律。全球邊緣計算支出預計到 2028 年將以 14% 的複合年增長率達到 3800 億美元,這一增長的重要部分由企業將 AI 推理移向數據所在地驅動。
什麼構成小型語言模型?
沒有正式的行業定義,但在實踐中,小型語言模型 (SLM) 是參數約 140 億或更少的模型,可以在標準企業硬件上運行——包括 CPU、消費級 GPU,以及越來越多嵌入在現代工作站和筆記本電腦中的 NPU。
當前的 SLM 格局包括幾個強勁的競爭者:
| 模型 | 參數 | 開發商 | 許可證 |
|---|---|---|---|
| Phi-4 | 14B | Microsoft | MIT |
| Gemma 2 | 9B | 寬鬆許可 | |
| Llama 3.1 | 8B | Meta | 自定義(商業可用) |
| Qwen 2.5 | 7B | Alibaba | Apache 2.0 |
| Mistral 7B | 7B | Mistral AI | Apache 2.0 |
| Phi-3 mini | 3.8B | Microsoft | MIT |
這些不是玩具。量化的 7B 模型可以在擁有 8GB VRAM 的單個消費級 GPU 上進行推理,甚至可以在現代 CPU 上以許多生產任務可接受的延遲運行。14B 模型可以舒適地在 RTX 4090(24GB VRAM)這樣的工作站級 GPU 上運行。