On-Device 與雲端 API:在 10K、50K 與 100K MAU 時的真實成本數學
對雲端 API 定價與規模化 on-device 推論的成本進行毫不誇張的拆解。看看 on-device fine-tuning 究竟在何時回本,附完整表格、真實定價資料,以及那些沒人寫進 README 的隱藏成本。
你的 AI 功能在測試環境裡表現完美。回應迅速、模型有能力、成本可以忽略不計。然後你達到了 10K 月活躍使用者,帳單也跟著到了。
這個時 刻,把能擴張的應用程式與那些悄悄被推倒重來的應用程式區分開。根據 Forrester 2026 年的報告,百分之七十的 CIO 把 AI 成本不可預測性列為最大的採用障礙。Menlo Ventures 發現,組織 AI 月均支出從 2024 年的 6.3 萬美元跳升到 2025 年的 8.55 萬美元,一年內成長 36%。Replit 的毛利率據報導隨推論用量擴張從 +36% 擺動到 -14%(Sacra)。
好消息是:你可以在它發生之前就把它建模出來。本文展示這套數學。
價格全景
首先,我們先把真實的數字擺出來。所有價格按每 100 萬 tokens 計,資料為 2026 年初。
| 模型 | 輸入(每 100 萬 tokens) | 輸出(每 100 萬 tokens) |
|---|---|---|
| OpenAI GPT-4o | $2.50 | $10.00 |
| OpenAI GPT-4.1-mini | $0.40 | $1.60 |
| OpenAI GPT-4o-mini | $0.15 | $0.60 |
| Anthropic Claude 3.5 Haiku | $0.80 | $4.00 |
| Google Gemini 2.0 Flash | $0.10 | $0.40 |
在每一家供應商那裡,輸出 tokens 的成本都明顯高於輸入 tokens。這一點很重要,因為大多數成本估算只關注輸入長度,而低估了輸出端。
成本模型:幾個假設
為了讓討論具體起來,我們需要一個基準用量假設。下面是一個帶有 AI 助理功能的行動應用程式的合理模型:
- 每位使用者每天 3 次互動(對一款日常使用的應用程式而言較為保守)
- 每次互動 500 輸入 tokens(簡短的 system prompt 加上使用者訊息)
- 每次互動 500 輸出 tokens(段落長度的回覆)
- 月活躍使用者分別為 10K、50K 與 100K
也就是每位使用者每月 30 次互動,每次互動總計 1,000 tokens(輸入和輸出各佔一半)。
每位使用者每月總 tokens:30,000(15K 輸入 + 15K 輸出)。
規模化下的雲端 API 成本
下面是這套數學在三個 MAU 節點產生的結果。
10,000 MAU
| 模型 | 月成本 |
|---|---|
| Gemini 2.0 Flash | $67.50 |
| GPT-4o-mini | $337.50 |
| GPT-4.1-mini | $900.00 |
| Claude 3.5 Haiku | $1,500.00 |
| GPT-4o | $5,625.00 |
50,000 MAU
| 模型 | 月成本 |
|---|---|
| Gemini 2.0 Flash | $337.50 |
| GPT-4o-mini | $1,687.50 |
| GPT-4.1-mini | $4,500.00 |
| Claude 3.5 Haiku | $7,500.00 |
| GPT-4o | $28,125.00 |
100,000 MAU
| 模型 | 月成本 |
|---|---|
| Gemini 2.0 Flash | $675.00 |
| GPT-4o-mini | $3,375.00 |
| GPT-4.1-mini | $9,000.00 |
| Claude 3.5 Haiku | $15,000.00 |
| GPT-4o | $56,250.00 |
這些是最低估算。它們不包含重試邏輯、串流額外負擔、隨對話延伸而成長的上下文視窗,也不包含執行 RAG 時 embedding 呼叫的成本。真實世界的 token 用量通常是估算值的 1.5 到 2 倍。
On-Device 這條替代路線
On-device 推論把模型跑在使用者的硬體上。模型分發完成之後,每一次推論對你來說都是零成本。沒有按 token 收費、沒有 API 呼叫、沒有出口流量費。
你真正需要支付的兩塊成本是:
-
Fine-tuning(一次性):在雲端 GPU 服務上訓練一個 LoRA 適配器,根據資料集大小和基礎模型不同大約要花 $5–$50。這是每個模型版本的一次性成本,不是按使用者或按推論收費。
-
模型分發(每次安裝一次性):你隨應用程式一起發送一個 GGUF 檔案。適合行動端的實用模型 GGUF 體積:Llama 3.2 1B 的 Q4_K_M 量化版是 808MB;3B 版本是 2.02GB。1GB 檔案按標準費率走 CDN 出口,每次安裝不到 $0.10。對 10K 使用者來說,這意味著大約 $1,000 的總分發成本,在安裝時攤銷,而不是按月發生。
月度持續成本:$0。
收支平衡點
以 GPT-4o-mini 作為基準(注重成本的團隊常用之選):
| MAU | GPT-4o-mini 月成本 | On-Device 月成本 | 收支平衡(月數) |
|---|---|---|---|
| 10K | $337.50 | $0 | 上線後不到 1 個月 |
| 50K | $1,687.50 | $0 | 上線後不到 1 個月 |
| 100K | $3,375.00 | $0 | 上線後不到 1 個月 |
只要 MAU 超過幾百,$5–$50 的一次性 fine-tuning 成本基本上在第一個月就會回本。真正的成本只剩整合所需的工程時間和最初的模型分發。
雲端 API 的隱藏成本
價格表並不是故事的全部。雲端 API 依賴會帶來一組不會出現在月帳單上的成本。
速率限制與延遲尖峰
每一家主要供應商都會施加速率限制:每分鐘 tokens、每分鐘請求數、每日上限。這些都按帳戶等級分層,要往上調通常需要數週的使用歷史。在出現尖峰的時候(走紅的瞬間、產品發布、某個功能開始流行),你恰恰會在最需要可靠性的時候撞上限制。速率限制錯誤需要客戶端的重試邏輯,這增加了複雜度,並可能級聯成使用者能感知到的故障。
延遲也會浮動。雲端模型端點是共享基礎設施。在尖峰負載期,P99 延遲可能達到 5–10 秒。相對地,on-device 推論是確定性的。它跑在專屬硬體上,沒有網路來回。