Back to blog
    phi-4microsoftfine-tuningenterpriseslm

    微调 Phi-4 14B:显存、速度与基准

    如何用 QLoRA 在 12 GB 显存上微调 Phi-4 14B,包含各量化档位在 RTX 4090 上的每秒 token 数,以及与 Llama 3.1、Qwen 2.5 的准确率对比。

    Edward Xi Yang

    微软 Phi-4 是一个 14B 参数模型,在 MATH 基准上得分 84.8%——高于 GPT-4 的 84.3%。一个小到可以在单个消费级 GPU 上运行的模型,在数学推理上超越了万亿参数模型。

    为什么企业选 Phi-4

    • **数学推理:**MATH 84.8%,GSM8K 93.2%
    • **结构化输出:**开箱即用 96% JSON Schema 合规性
    • **指令跟随:**可靠追踪多部分指令
    • **代码生成:**HumanEval 82.6%

    最佳企业用例

    金融文档处理

    微调后:96% 收入表行项提取准确率,98% 数值计算准确率。

    复杂分类法分类

    32 类支持工单分类:Phi-4 94%,Llama 3.1 8B 89%,GPT-4o 87%。

    结构化数据提取

    合同条款提取:Phi-4 93% 字段级准确率,97% JSON 有效性。

    量化推荐

    量化准确率JSON 有效性模型大小
    Q5_K_M92.8%96.8%10 GB
    Q4_K_M92.1%96.2%8.5 GB

    Q5_K_M 比 FP16 仅损失 0.4% 准确率,快 73%,小 64%。


    延伸阅读

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading