apple-siliconm-serieslocal-inferenceollamamlxfine-tuningdeploymentgguf
在 Apple Silicon 上執行微調模型:Ollama 與 MLX
各代 M 系列 Mac 分別能跑動多大的模型,以及如何用 Ollama、MLX 或 llama.cpp 在本機部署一個微調過的模型,讓每次查詢的推論成本真正降為零而無需依賴雲端。
Edward Xi Yang
Apple Silicon 對於本地 AI 推理有一個大多數人低估的靜默優勢:統一記憶體。CPU、GPU 和神經引擎都共享同一個記憶體池——沒有在獨立的 VRAM 和系統 RAM 之間複製資料。對於大型語言模型推理(其中記憶體頻寬是主要瓶頸),這種架構是真正的競爭優勢。
如果你擁有 M 系列 Mac,你已經擁有了有能力的 AI 推理硬體。本指南介紹如何從 Ertas 獲取微調模型,並在你的 Mac 上本地部署——無雲 API、無 GPU 租賃、無按 token 計費。
你的 Mac 可以運行什麼
本地 LLM 推理的限制因素是記憶體。以下是每個 M 系列層級支援的內容:
| Mac | 統一記憶體 | 推薦模型 | 預期速度 |
|---|---|---|---|
| M1/M2/M3/M4(基礎版) | 8-16 GB | 1-3B 量化,7B 在 Q4(緊張) | 約 15-25 tok/s |
| M1/M2/M3/M4 Pro | 18-24 GB | 7-8B 在 Q5/Q8,13B 在 Q4 | 約 25-35 tok/s |
| M1/M2/M3/M4 Max | 32-128 GB | 13B 在 Q8,70B 在 Q4 | 約 15-30 tok/s |
| M2/M4 Ultra | 64-192 GB | 70B 在 Q8,同時多個模型 | 約 20-35 tok/s |
大多數開發者的甜蜜點: 運行 Q5_K_M 或 Q8_0 的微調 8B 模型的 M4 Pro(24 GB)。這提供了超過 30 個 token/秒——足夠快用於互動式使用——並且有充足的上下文視窗空間。
有關選擇量化等級的指導,請參閱我們的量化指南。
為何統一記憶體很重要
在傳統帶獨立 GPU 的 PC 上,LLM 推理工作如下:
- 模型權重存在 GPU VRAM(消費者卡上限制在 8-24 GB)
- 如果模型不適合 VRAM,部分溢出到系統 RAM
- 從 GPU 訪問系統 RAM 比 VRAM 慢 10-20 倍
- 這種「卸載」會殺死性能
在 Apple Silicon 上:
- 一切——CPU、GPU、神經引擎——訪問同一個記憶體池
- 沒有 VRAM/RAM 區別
- 帶 64 GB 統一記憶體的 Mac 以全速給 GPU 訪問所有 64 GB
- 沒有卸載懲罰
這意味著帶有 192 GB 統一記憶體的 Mac Studio M4 Ultra 可以運行傳統設置上需要多個企業 GPU 的模型。對於推理(而非訓練),Apple Silicon 令人驚訝地具有競爭力。