llama-3fine-tuningmetaloratutorialgguf
微调 Llama 3:针对您用例的实用指南
微调 Meta Llama 3 模型的实操指南——涵盖模型选择、数据集准备、LoRA 配置、训练技巧以及部署为 GGUF 进行本地推理。
Edward Xi Yang
Llama 3 是最强大的开源模型系列之一。其强大的基线性能、宽松许可和广泛的社区支持使其成为大多数微调项目的默认起点。
选择正确的 Llama 3 变体
Llama 3 8B
主力变体。适合分类、提取、结构化输出、初次微调。16GB VRAM 即可用 LoRA 微调。
Llama 3 70B
重量级。适合复杂推理、长文本生成。需要多 GPU 设置。
建议:从 Llama 3 8B 开始。
LoRA 配置推荐
| 参数 | 值 |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| 目标模块 | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| 学习率 | 2e-4 |
| Epochs | 3 |
预期改善
| 指标 | 基础 Llama 3 8B(提示) | 微调 Llama 3 8B |
|---|---|---|
| 任务准确率 | 60-75% | 85-95% |
| 格式一致性 | 70-80% | 95-99% |
| 幻觉率 | 10-20% | 2-5% |
部署
cat > Modelfile << 'EOF'
FROM ./llama-3-8b-my-task.gguf
SYSTEM "You are a medical coding assistant."
PARAMETER temperature 0.1
EOF
ollama create medical-coder -f Modelfile
ollama run medical-coderErtas 套餐 $10/月起。 查看定价 →
延伸阅读
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
将 Claude 或 GPT 蒸馏为本地 7B 模型
逐步教程:用 Claude 或 GPT-4o 生成合成数据集,用 LoRA 微调 7B 模型,导出为 GGUF 并在本地通过 Ollama 运行。
Edward Xi Yang
如何合法蒸馏开源模型
当教师模型的许可证允许衍生作品时,模型蒸馏就是合法的。如何选择开源教师模型、训练学生模型并导出为 GGUF。
Edward Xi Yang
用你的微调本地模型替换 OpenAI Agents SDK 中的 OpenAI
OpenAI Agents SDK 刻意保持模型无关。把 OpenAI 客户端换成在 Ollama 上运行的 Ertas 训练模型,你保留开发体验同时干掉按 token 成本。一份直接替换教程。
Edward Xi Yang