qwenmultilingualfine-tuninginternationalslm
Qwen 2.5 多语言微调:29 种语言
Qwen 2.5 覆盖 29 种语言。微调一个模型即可处理多语言分类、客服支持和文档抽取,无需为每种语言单独训练模型。
Edward Xi Yang
大多数开源语言模型以英语为主。Qwen 2.5 不同。阿里巴巴在 18 万亿 token 上训练,覆盖 29 种语言,对非拉丁文字和从右到左语言有真正的投入。
为什么 Qwen 在多语言上胜出
- 英语约 40%,中文约 25%,欧洲语言约 15%,亚洲语言约 10%,阿拉伯语/印地语等约 7%
- 152K 词汇分词器:中文约 1.5 token/字符(vs Llama 的 2-3)
多语言基准
| 基准 | Qwen 2.5 7B | Llama 3.1 8B |
|---|---|---|
| MGSM(多语言数学) | 72.4% | 61.2% |
| XNLI(跨语言 NLI) | 78.6% | 69.4% |
多语言微调配置
LoRA rank 32(高于单语的 16),学习率 1.5e-4,4-5 epochs。混合语言示例在每个 batch 中。
Qwen 2.5 7B vs Llama 3.1 8B 非英语任务
| 语言 | Qwen 2.5 7B | Llama 3.1 8B |
|---|---|---|
| 英语 | 95% | 96% |
| 德语 | 93% | 84% |
| 中文 | 92% | 71% |
| 阿拉伯语 | 89% | 63% |
| 日语 | 91% | 68% |
| 印地语 | 87% | 58% |
| 平均 | 91.9% | 76.6% |
如果您的应用涉及任何非英语语言,Qwen 2.5 是显而易见的选择。
延伸阅读
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
Gemma 3 4B 端侧延迟与部署
微调后的 Gemma 3 4B 在 iPhone、Pixel、树莓派和浏览器上的实测延迟与准确率,并附上 QLoRA 训练参数和 GGUF 量化档位的选择建议。
Edward Xi Yang
微调 Phi-4 14B:显存、速度与基准
如何用 QLoRA 在 12 GB 显存上微调 Phi-4 14B,包含各量化档位在 RTX 4090 上的每秒 token 数,以及与 Llama 3.1、Qwen 2.5 的准确率对比。
Edward Xi Yang
结构化输出微调:JSON Schema 合规
JSON mode 给您有效的 JSON。微调给您有保障的 Schema 合规:每个字段、每个类型、每次都对。以下是训练模型的方法。
Edward Xi Yang