Fine-Tune LFM2.5 1.2B with Ertas

    LFM2.5-1.2B-Instruct 是 Liquid AI 的旗舰设备端模型,参数量 1.17B,在 IFEval 上取得 86.23、MMLU-Pro 上取得 44.35,运行内存不足 1GB。它是 LFM2.5 中最大的规模,也是当模型需要维持多轮对话或驱动智能体循环时应当选择的版本。

    1.2B实际 1.17BLiquid AI

    LFM2.5 1.2B at a Glance

    完整名称LFM2.5-1.2B-Instruct
    开发方Liquid AI
    参数量1.17B
    层数16 层(10 个双门控卷积块 + 6 个 GQA 块)
    训练预算28 万亿 token
    上下文长度32,768 token
    词表大小65,536
    知识截止2024 年年中
    支持语言英语、阿拉伯语、中文、法语、德语、日语、韩语、西班牙语
    发布日期2026 年 1 月 5 日
    许可协议LFM Open License v1.0(lfm1.0)
    在 Ertas 上微调所需 GPU 层级T4
    可在 Ertas 免费套餐上训练
    Q4_K_M 导出体积731 MB
    Ertas 镜像ErtasAI/LFM2.5-1.2B-Instruct

    Overview

    LFM2.5-1.2B-Instruct 是 Liquid AI LFM2.5 家族中最大的文本模型,也是 2026 年 1 月 5 日那次发布的旗舰。它拥有 1.17B 参数、16 层结构,按 10 个双门控短程卷积块与 6 个分组查询注意力块划分,预训练量为 28 万亿 token,并在其上叠加了大规模多阶段强化学习流水线。

    上下文窗口为 32,768 token,词表为 65,536,这个规模是刻意压缩的。在这个参数量级上,嵌入与反嵌入表在文件体积中占比很大,因此更小的词表会直接换来更小的下载体积。这也是为什么它的 Q4_K_M 导出为 731MB,而纸面上更小的 Gemma 3 1B 导出却是 810MB。

    这个模型真正擅长什么,从基准的形态就能看出来。它在 IFEval 上取得 86.23、IFBench 上取得 47.33(两者都是指令遵循类指标),而 Qwen3-1.7B 分别为 73.68 和 21.33。在 GPQA 上为 38.89 对 34.85,MMLU-Pro 上为 44.35 对 42.91。与规模最接近的 Llama 3.2 1B 相比差距更大:IFEval 86.23 对 52.37,MMLU-Pro 44.35 对 20.80。

    Liquid 推荐将其用于智能体任务、数据抽取和 RAG,并建议避开知识密集型工作与编程。这是对其能力画像的准确描述:它以超出规模的可靠性遵循指令,同时对世界的了解不如云端模型,因此它是一个好的执行者,而不是一部好的百科全书。

    除 instruct 版本外还有三个同源检查点:用于重度微调的 LFM2.5-1.2B-Base、推荐温度更低(0.05)的推理版 LFM2.5-1.2B-Thinking,以及针对日语优化的 LFM2.5-1.2B-JP。Ertas 目录收录的是 instruct 检查点,镜像地址为 `ErtasAI/LFM2.5-1.2B-Instruct`。

    Key Features

    IFEval 86.23 的指令遵循能力是它最突出的特性。作为对比,Granite-4.0-h-1b 为 80.08,Qwen3-1.7B 为 73.68,Gemma 3 1B 为 63.25,Llama 3.2 1B 为 52.37。使用更难、更少见约束的 IFBench 把差距拉得更开:LFM2.5 为 47.33,次优者为 24.93。如果你的微调模型必须在每次请求中都输出特定格式,这个维度决定了它在生产环境中是否可用。

    工具调用是原生能力。模型默认在 `<|tool_call_start|>` 与 `<|tool_call_end|>` token 之间写出 Python 式函数调用,解读工具返回结果,然后以纯文本作答。如果你的运行时期望 JSON 形式,也可以通过系统提示词切换。对话模板为类 ChatML 格式,因此大多数现有工具链无需特殊处理即可解析。

    在 Liquid 实测的每个目标上,内存占用都保持在 1GB 以内。在 Galaxy S25 Ultra 上占用 719MB,而同一设备上的 Qwen3-1.7B 需要 1,306MB,预填充 335 token/秒,解码 70 token/秒。在 AMD Ryzen AI 9 HX 370 上占用 856MB,预填充 2,975,解码 116。在 Qualcomm Dragonwing IQ9 IoT NPU 上占用 0.9GB,预填充 2,143,解码 53。

    AIME25 的 14.00 值得如实看待。它高于 Qwen3-1.7B 的 9.33,也远超 Llama 3.2 1B 的 0.33,但绝对分数依然偏低。竞赛数学并不是一个 1.2B 设备端模型该做的事。如果你需要这一规模下的推理深度,Liquid 专门为此构建了 LFM2.5-1.2B-Thinking 检查点。

    Fine-Tuning with Ertas

    LFM2.5 1.2B 在 Ertas Studio 的 T4 层级上微调,并且在免费套餐的 5B 参数上限之内,因此一次完整训练可以零成本开始。权重原生支持 bf16,在 Turing 硬件上不会有回退 fp32 的性能损失。

    适用于这个规模的配方是:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。相比 7B 模型,1.2B 需要在小数据集上多走几遍行为才会稳定,并且能承受更高的学习率而不崩溃。

    导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器。Liquid 自己的 Q4_K_M 构建为 731MB;Ertas 将微调适配器合并进这一基础模型后导出的 [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 为 697MB,这是一个《星露谷物语》模组,用生成式的角色对白替换了村民原本固定的台词,并完全运行在玩家自己的 CPU 上。

    那个项目是我们目前关于微调这个模型最详细的公开记录,其中两个发现值得带进你自己的训练。第一,1.2B 能维持多轮对话,而同家族的 350M 会开始回答没人问过的问题,而且这个差别只有靠真正对话才能发现。无破折号率、越狱泄漏率、句长分布和退化度在两种规模上都是干净的。

    第二个发现关于附和倾向。让模型在采样式对抗压力下拒绝一个虚假前提,比让它保持某种语气难得多。监督微调塑造了这一行为却没有消除它,40 组偏好对的 LoRA DPO 只是把同一个天花板往外推了一点,并没有捅破它。贪心解码完全看不到这个问题。如果你的微调需要模型对用户的断言提出反驳,请为此单独留出预算,并用采样方式去探测它。

    Use Cases

    设备端助手是首要场景。在旗舰手机上占用 719MB、解码 70 token/秒,一个微调后的 1.2B 能以接近对话的节奏作答,无需网络往返,也没有按次调用成本。Liquid 将智能体任务、数据抽取和 RAG 列为推荐三件套,而指令遵循分数支撑了这三者。

    本地运行的工具调用智能体是最契合的用法。原生 Python 式函数调用、可容纳工具定义与返回结果的 32,768 token 上下文,加上 86.23 的 IFEval,意味着模型能稳定产出你的运行时可以解析的调用。再搭配检索,让事实来自你的索引,模型负责编排。

    游戏与角色 AI 是 Chatty Valley 演示的模式:一个明确的人设、几百行训练数据,以及一个玩家真的会接受的 697MB 下载体积。规模在这里之所以重要有一个具体原因:角色类工作需要在十几轮对话中保持连贯,而这恰恰是 350M 最先失去的能力。

    当原文就在提示词里时,文档处理与结构化抽取表现良好。高指令遵循加上中等世界知识,正是把合同、表单或邮件转成结构化字段所需要的画像。

    应当另寻他路的场景:知识密集型问答、代码生成和竞赛数学。Liquid 直接这么说,MMLU-Pro 44.35 与 AIME25 14.00 就是证据。对于这些任务,目录中 7B 或 8B 的基础模型是更好的起点。

    Hardware Requirements

    推理,依据 Liquid AI 的实测数据。搭载 Snapdragon Gen4 的 Samsung Galaxy S25 Ultra:预填充 335 token/秒,解码 70 token/秒,内存 719MB。AMD Ryzen AI 9 HX 370 CPU:预填充 2,975,解码 116,占用 856MB。Qualcomm Dragonwing IQ9 IoT NPU:预填充 2,143,解码 53,占用 0.9GB。以上每个目标都保持在 1GB 以内。

    导出体积,读取自 Liquid 公布的 GGUF 构建:Q4_0 为 696MB,Q4_K_M 为 731MB,Q5_K_M 为 843MB,Q6_K 为 963MB,Q8_0 为 1.25GB,BF16 为 2.34GB。除非你已经实测出提高精度的质量收益,否则 Q4_K_M 是值得直接发布的默认选择。

    在 Ertas 上微调时,T4 层级即可胜任,这是入门层级,也是免费套餐使用的层级,无需 A10G。

    如果在 Ertas 之外本地微调,1.2B 的 QLoRA 需要 8GB 或以上显存,RTX 3060 12GB 及更好的显卡都在射程之内。在这个规模下单步训练速度足够快,真正耗掉一周时间的会是数据集迭代,而不是 GPU 时间。

    Frequently Asked Questions

    LFM2.5 1.2B 是什么?
    LFM2.5-1.2B-Instruct 是 Liquid AI 于 2026 年 1 月 5 日发布的旗舰设备端语言模型。它拥有 1.17B 参数、16 层结构,混合了 10 个双门控卷积块与 6 个分组查询注意力块,上下文窗口为 32,768 token,预训练量为 28 万亿 token。它可在手机、CPU 和 NPU 上以不足 1GB 的内存运行。
    LFM2.5 1.2B 与 Qwen3-1.7B、Llama 3.2 1B 相比如何?
    在 Liquid AI 公布的基准结果中,LFM2.5-1.2B-Instruct 的 IFEval 为 86.23,Qwen3-1.7B 为 73.68,Llama 3.2 1B 为 52.37。IFBench 上为 47.33 对 21.33 和 15.93。MMLU-Pro 上为 44.35 对 42.91 和 20.80。GPQA 上为 38.89 对 34.85 和 16.57。此外它在 Galaxy S25 Ultra 上仅占用 719MB,而 Qwen3-1.7B 需要 1,306MB。
    微调后的 LFM2.5 1.2B 导出文件有多大?
    依据 Liquid AI 公布的 GGUF 构建,Q4_K_M 下约为 731MB。Ertas 为《星露谷物语》模组 Chatty Valley 导出的微调版 1.2B 发布体积为 697MB。Q8_0 下约 1.25GB,BF16 下为 2.34GB。
    我该用 LFM2.5 1.2B 还是 LFM2.5 350M?
    当模型需要跨多轮维持对话或运行智能体循环时,选 1.2B。当每次请求彼此独立时(例如抽取、分类或单次工具调用),并且 229MB 的更小下载体积很重要时,选 350M。
    我们在构建 Chatty Valley 时直接做过这场对比。微调后的 350M 完美保持了角色的语气与格式,随后却在多轮随意对话中跟丢了线索,对没有被问到的问题给出流畅且完全符合人设的回答。所有自动化指标都显示 350M 没问题,只有一套脚本化的对话探针发现了它。
    可以在 Ertas 上免费微调 LFM2.5 1.2B 吗?
    可以。1.17B 参数远低于免费套餐的 5B 上限,并且在 T4 GPU 层级上训练。对 2B 以下的基础模型,推荐配方为学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。
    LFM2.5 1.2B 支持工具调用吗?
    原生支持。它在专用的 `<|tool_call_start|>` 与 `<|tool_call_end|>` token 之间写出 Python 式函数调用,基于返回的工具结果继续执行,并以纯文本作答。你也可以通过系统提示词切换为 JSON 格式的调用。对话模板为类 ChatML 格式。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.