gemmagoogleon-deviceedge-aifine-tuningslm
Gemma 3 4B 端侧延迟与部署
微调后的 Gemma 3 4B 在 iPhone、Pixel、树莓派和浏览器上的实测延迟与准确率,并附上 QLoRA 训练参数和 GGUF 量化档位的选择建议。
Edward Xi Yang
在手机、Raspberry Pi 或 IoT 网关上运行 AI——完全不经过服务器——改变了可能性。无网络往返延迟。无随用户增长的 API 费用。无互联网依赖。数据完全不离开设 备。
4B 模型是大多数端侧部署的目标。Q4_K_M 量化下不到 3 GB RAM——完全在现代智能手机、Raspberry Pi 5 或浏览器标签页能力范围内。
推理速度对比(Q4_K_M)
| 硬件 | Gemma 3 4B | Llama 3.2 3B |
|---|---|---|
| iPhone 15 Pro (ANE) | 28 t/s | 24 t/s |
| Pixel 8 Pro (GPU) | 22 t/s | 19 t/s |
| Raspberry Pi 5 (CPU) | 6.4 t/s | 5.5 t/s |
| M2 MacBook Air (GPU) | 48 t/s | 41 t/s |
| 浏览器 (WebLLM) | 12 t/s | 10 t/s |
Gemma 3 在所有端侧目标上快 15-30%。
端侧任务的数据集策略
**短输入,简洁输出。**端侧上每个 token 都有延迟和内存成本:
{"instruction": "Classify intent", "input": "Where's my order?", "output": "order_status"}包含真实设备使用的边缘情况——更多打字错误、缩写、非正式语言。
集成模式
- React Native + llama.rn:分类延迟 80-150ms
- iOS Core ML:ANE 上 32-35 t/s
- Android NNAPI:NPU 推理功耗低 50-60%
- 浏览器 WebLLM:模型下载一次并缓存
- Raspberry Pi llama.cpp:IoT 和边缘部署
真实设备基准
微调 Gemma 3 4B(Q4_K_M)12 类意图分类任务:
| 设备 | 准确率 | 延迟(平均) |
|---|---|---|
| iPhone 15 Pro | 94% | 65ms |
| Pixel 8 Pro | 94% | 85ms |
| Raspberry Pi 5 | 94% | 280ms |
| 浏览器 (Chrome, M2) | 94% | 110ms |
200 美元手机上的端侧模型延迟击败世界最佳 API 10 倍。
延伸阅读
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
微调 Phi-4 14B:显存、速度与基准
如何用 QLoRA 在 12 GB 显存上微调 Phi-4 14B,包含各量化档位在 RTX 4090 上的每秒 token 数,以及与 Llama 3.1、Qwen 2.5 的准确率对比。
Edward Xi Yang
Qwen 2.5 多语言微调:29 种语言
Qwen 2.5 覆盖 29 种语言。微调一个模型即可处理多语言分类、客服支持和文档抽取,无需为每种语言单独训练模型。
Edward Xi Yang
SmolLM2 的三个尺寸:135M、360M 与 1.7B
SmolLM2 提供 135M、360M 和 1.7B 三个尺寸。对比它们的 GGUF 文件体积、在 iPhone 与树莓派上的速度,以及各自需要的微调配置。
Edward Xi Yang