phi-4microsoftfine-tuningenterpriseslm
微调 Phi-4 14B:显存、速度与基准
如何用 QLoRA 在 12 GB 显存上微调 Phi-4 14B,包含各量化档位在 RTX 4090 上的每秒 token 数,以及与 Llama 3.1、Qwen 2.5 的准确率对比。
Edward Xi Yang
微软 Phi-4 是一个 14B 参数模型,在 MATH 基准上得分 84.8%——高于 GPT-4 的 84.3%。一个小到可以在单个消费级 GPU 上运行的模型,在数学推理上超越了万亿参数模型。
为什么企业选 Phi-4
- **数学推理:**MATH 84.8%,GSM8K 93.2%
- **结构化输出:**开箱即用 96% JSON Schema 合规性
- **指令跟随:**可靠追踪多部分指令
- **代码生成:**HumanEval 82.6%
最佳企业用例
金融文档处理
微调后:96% 收入表行项提取准确率,98% 数值计算准确率。
复杂分类法分类
32 类支持工单分类:Phi-4 94%,Llama 3.1 8B 89%,GPT-4o 87%。
结构化数据提取
合同条款提取:Phi-4 93% 字段级准确率,97% JSON 有效性。
量化推荐
| 量化 | 准确率 | JSON 有效性 | 模型大小 |
|---|---|---|---|
| Q5_K_M | 92.8% | 96.8% | 10 GB |
| Q4_K_M | 92.1% | 96.2% | 8.5 GB |
Q5_K_M 比 FP16 仅损失 0.4% 准确率,快 73%,小 64%。
延伸阅读
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
Gemma 3 4B 端侧延迟与部署
微调后的 Gemma 3 4B 在 iPhone、Pixel、树莓派和浏览器上的实测延迟与准确率,并附上 QLoRA 训练参数和 GGUF 量化档位的选择建议。
Edward Xi Yang
Qwen 2.5 多语言微调:29 种语言
Qwen 2.5 覆盖 29 种语言。微调一个模型即可处理多语言分类、客服支持和文档抽取,无需为每种语言单独训练模型。
Edward Xi Yang
结构化输出微调:JSON Schema 合规
JSON mode 给您有效的 JSON。微调给您有保障的 Schema 合规:每个字段、每个类型、每次都对。以下是训练模型的方法。
Edward Xi Yang