Back to blog
    qwenmultilingualfine-tuninginternationalslm

    Qwen 2.5 多语言微调:29 种语言

    Qwen 2.5 覆盖 29 种语言。微调一个模型即可处理多语言分类、客服支持和文档抽取,无需为每种语言单独训练模型。

    Edward Xi Yang

    大多数开源语言模型以英语为主。Qwen 2.5 不同。阿里巴巴在 18 万亿 token 上训练,覆盖 29 种语言,对非拉丁文字和从右到左语言有真正的投入。

    为什么 Qwen 在多语言上胜出

    • 英语约 40%,中文约 25%,欧洲语言约 15%,亚洲语言约 10%,阿拉伯语/印地语等约 7%
    • 152K 词汇分词器:中文约 1.5 token/字符(vs Llama 的 2-3)

    多语言基准

    基准Qwen 2.5 7BLlama 3.1 8B
    MGSM(多语言数学)72.4%61.2%
    XNLI(跨语言 NLI)78.6%69.4%

    多语言微调配置

    LoRA rank 32(高于单语的 16),学习率 1.5e-4,4-5 epochs。混合语言示例在每个 batch 中。

    Qwen 2.5 7B vs Llama 3.1 8B 非英语任务

    语言Qwen 2.5 7BLlama 3.1 8B
    英语95%96%
    德语93%84%
    中文92%71%
    阿拉伯语89%63%
    日语91%68%
    印地语87%58%
    平均91.9%76.6%

    如果您的应用涉及任何非英语语言,Qwen 2.5 是显而易见的选择。


    延伸阅读

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading