Fine-Tune LFM2.5 350M with Ertas

    LFM2.5-350M 是 Liquid AI 的微型边缘模型,享有完整的 28 万亿 token 训练预算,在 BFCLv3 函数调用上取得 44.11。量化后导出体积为 229MB,在 iPhone 13 Mini 上仅占用 56MB,因此它是单次请求独立场景下工具调用与结构化抽取的首选。

    350MLiquid AI

    LFM2.5 350M at a Glance

    完整名称LFM2.5-350M
    开发方Liquid AI
    参数量350M
    层数16 层(10 个双门控卷积块 + 6 个 GQA 块)
    训练预算28 万亿 token
    上下文长度32,768 token
    词表大小65,536
    知识截止2024 年年中
    支持语言英语、阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语、西班牙语
    发布日期2026 年 3 月 31 日
    许可协议LFM Open License v1.0(lfm1.0)
    在 Ertas 上微调所需 GPU 层级T4
    可在 Ertas 免费套餐上训练
    Q4_K_M 导出体积229 MB
    Ertas 镜像ErtasAI/LFM2.5-350M

    Overview

    LFM2.5-350M 是 Liquid AI LFM2.5 家族中的中间规模,发布于 2026 年 3 月 31 日。它与 1.2B 共享完全相同的层结构:16 层,按 10 个双门控短程卷积块与 6 个分组查询注意力块划分,并享有同样的 28 万亿 token 预训练预算。两者的差别在于参数量,而 350M 拿到的是完整训练,而不是缩水版本。

    这一点比听上去更重要。小模型通常相对其容量而言训练不足,因为算力预算往往跟着参数量走。把 28T token 的预算投在 350M 参数上,才能产出一个 IFEval 76.96 的模型,高于体量更大的 Gemma 3 1B(63.49)和 Qwen3.5-0.8B(59.94)。

    函数调用分数是最亮眼的部分。BFCLv3 的 44.11 与 BFCLv4 的 21.86 让 350M 领先于 Granite 4.0-H-350M(43.07 和 13.28)、Qwen3.5-0.8B(35.08 和 18.70),并大幅领先于自家前代 LFM2-350M(22.95 和 12.29)。在临床结构化抽取基准 CaseReportBench 上,它取得 32.45,而 Qwen3.5-0.8B 为 13.83,Gemma 3 1B 为 2.28。

    上下文窗口与家族其他成员一致,为 32,768 token,词表为 65,536。量化到 Q4_K_M 后导出体积为 229MB。在 iPhone 13 Mini 上通过 Cactus 引擎运行时占用 56MB,解码 88 token/秒,这样的占用可以直接放进一个移动应用,而不必展开一场关于下载体积的讨论。

    Liquid 推荐将其用于数据抽取、结构化输出和工具使用,并建议避开知识密集型任务、编程、数学和创意写作。Ertas 目录收录的镜像地址为 `ErtasAI/LFM2.5-350M`。

    Key Features

    在 350M 参数上做函数调用,是选择这个模型的理由。BFCLv3 的 44.11 与 230M 相差不到一分,也接近许多 1B 级模型的水平,而一代之前的 LFM2-350M 在同一基准上只有 22.95。模型默认在 `<|tool_call_start|>` 与 `<|tool_call_end|>` token 之间写出 Python 式调用,也可通过系统提示词切换为 JSON。

    结构化抽取是与之配套的强项。CaseReportBench 的 32.45 衡量的是从非结构化病例报告中提取结构化临床字段的能力,350M 的成绩是 Qwen3.5-0.8B(13.83)的两倍以上。再结合 IFBench 的 40.69,这描绘出一个能稳定产出你所要求格式的模型。

    单一检查点的部署覆盖面异常之广。Liquid 公布了五个差异极大的目标上的实测:Apple M5 Max 通过 Mirai 解码 564 token/秒;AMD Ryzen AI Max 395+ 通过 llama.cpp 解码 313;iPhone 13 Mini 通过 Cactus 解码 88,占用 56MB;Snapdragon 8 Elite NPU 通过 RunAnywhere 占用 169MB;树莓派 5 解码 30 token/秒,占用 300MB。在单张 H100 上,高并发时输出吞吐可达 40,400 token/秒,也就是说同一个能装进树莓派的模型也能承担批量负载。

    它覆盖九种语言:英语、阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语和西班牙语。多语言指令遵循基准 Multi-IF 的成绩是 44.92,高于 230M 的 37.70 和 Qwen3.5-0.8B 的 41.68。

    规模的代价体现在:MMLU-Pro 20.01 与 GPQA Diamond 30.64。世界知识比较薄弱,这是 350M 参数下预期中的取舍。把事实放进提示词里。

    Fine-Tuning with Ertas

    LFM2.5 350M 在 Ertas Studio 的 T4 层级上微调,并且远低于免费套餐的 5B 参数上限。权重原生支持 bf16,训练直接以 bf16 进行,不会回退到 fp32。

    适用于这个规模的配方是:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。在 350M 参数下,一次训练结束得足够快,你可以在一个下午里对数据集迭代好几轮,而真正的工作也正是在那里。

    导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器。Q4_K_M 导出约为 229MB,而 Qwen 2.5 0.5B 为 490MB,Gemma 3 1B 为 810MB。如果你的产品需要把模型下发给用户,这个差距就是「用户直接接受」与「用户要考虑一下」之间的差距。

    我们自己工作中的一个发现值得带上。在构建 [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 时,我们用同一份角色数据集分别微调了 350M 和 1.2B,并对两者跑了同一套评测。350M 完美保持了角色的语气与格式,产出的单句读起来完全对味。随后它跟丢了一段多轮随意对话的线索,回答了一个没有被问到的问题,还把同一个想法又重复了一遍,生怕你没看见。

    让这件事代价高昂的是:所有自动化指标在两种规模上都是干净的。无破折号率、越狱泄漏率、句长分布、退化度和数字年龄泄漏全部通过。这个失败只有靠真正对话才看得见。如果你要为任何对话类用途微调 350M,请写一套脚本化的多轮探针,并在相信指标面板之前先跑一遍。而对于单轮抽取和工具调用(也正是这个模型的定位),这个风险并不适用。

    Use Cases

    大批量结构化数据抽取是最契合的场景。每份文档都是独立请求,事实来自模型面前的文本,关键在于每次都输出正确的格式。IFBench 的 40.69 与 CaseReportBench 的 32.45 都指向这一点,而在单张 H100 上 40,400 token/秒的输出吞吐,让跨大规模语料运行它在经济上完全成立。

    边缘智能体中的工具调用是第二个场景。BFCLv3 的 44.11、原生 Python 式调用格式,以及可容纳工具定义的 32,768 token 上下文,意味着一个本地智能体可以在提示词中携带一套真实的工具集。搭配检索,让索引承担事实部分。

    离线运行的移动应用功能与这个占用相称。iPhone 13 Mini 上 56MB 内存、229MB 下载体积,足够让分类、自动补全、设备端内容摘要和表单填充作为后台功能运行,而不必成为应用的主打卖点。

    嵌入式与物联网部署在这里是现实可行的。Snapdragon 8 Elite NPU 上 169MB、树莓派 5 上 300MB,覆盖了大量无法舒适承载 1B 模型的硬件。

    应当另寻他路的场景:多轮对话、角色类工作,以及任何需要世界知识、代码或数学的任务。若需要同家族中的对话深度,请上移到 [LFM2.5 1.2B](/models/lfm2-5-1-2b)。若在类似的单轮工作中需要更小的占用,[LFM2.5 230M](/models/lfm2-5-230m) 让出的能力少得出人意料。

    Hardware Requirements

    推理,依据 Liquid AI 在五个目标上的实测。Apple M5 Max 通过 Mirai:预填充 44,800 token/秒,解码 564,占用 1GB。AMD Ryzen AI Max 395+ 通过 llama.cpp:预填充 2,900,解码 313,占用 434MB。Snapdragon 8 Elite NPU 通过 RunAnywhere:预填充 2,800,解码 15,占用 169MB。iPhone 13 Mini 通过 Cactus 引擎:预填充 496,解码 88,占用 56MB。树莓派 5 通过 Cactus:预填充 200,解码 30,占用 300MB。在单张 H100 上,高并发时输出吞吐峰值为 40,400 token/秒。

    导出体积,读取自 Liquid 公布的 GGUF 构建:Q4_0 为 219MB,Q4_K_M 为 229MB,Q5_K_M 为 260MB,Q6_K 为 293MB,Q8_0 为 379MB,BF16 为 712MB。在这个规模下值得试试 Q5_K_M 或 Q6_K,因为额外质量的绝对代价只有几十兆。

    在 Ertas 上微调时,T4 层级绰绰有余。它是入门层级,也是免费套餐使用的层级。

    如果在 Ertas 之外本地微调,350M 的 QLoRA 可装进 6GB 消费级 GPU,速度足以让几百行数据的一次完整训练在几分钟内跑完。

    Frequently Asked Questions

    LFM2.5 350M 是什么?
    LFM2.5-350M 是 Liquid AI 于 2026 年 3 月 31 日发布的 3.5 亿参数设备端语言模型。它采用 16 层结构,按 10 个双门控卷积块与 6 个分组查询注意力块划分,上下文窗口为 32,768 token,预训练量为 28 万亿 token,与同家族的 1.2B 享有相同预算。
    LFM2.5 350M 的函数调用能力如何?
    在 Liquid AI 公布的结果中,它的 BFCLv3 为 44.11,BFCLv4 为 21.86。这让它领先于 Granite 4.0-H-350M(43.07 和 13.28)、Qwen3.5-0.8B(35.08 和 18.70)、Gemma 3 1B IT(16.61 和 7.17),并约为自家前代 LFM2-350M(22.95 和 12.29)的两倍。函数调用是这个模型被设计来做好的两件事之一。
    微调后的 LFM2.5 350M 导出文件有多大?
    依据 Liquid AI 公布的 GGUF 构建,Q4_K_M 下约为 229MB。Q5_K_M 为 260MB,Q6_K 为 293MB,Q8_0 为 379MB。作为对比,Gemma 3 1B 在 Q4_K_M 下为 810MB,Qwen 2.5 0.5B 为 490MB。
    LFM2.5 350M 能维持对话吗?
    单轮任务才是它的位置。在我们自己的测试中,微调后的 350M 完美保持了角色的语气与格式,随后却在多轮随意对话中跟丢了线索,对没有被问到的问题给出流畅且完全符合人设的回答。我们跑的所有自动化指标在 350M 和 1.2B 上都通过了,只有一套脚本化的对话探针才暴露出这个差别。对于抽取、分类、结构化输出和工具调用这类每次请求彼此独立的任务,350M 是很好的选择。若需要对话能力,请上移到 LFM2.5 1.2B。
    什么硬件可以运行 LFM2.5 350M?
    Liquid AI 公布了五个目标上的实测:iPhone 13 Mini 占用 56MB、解码 88 token/秒;Snapdragon 8 Elite NPU 占用 169MB;树莓派 5 占用 300MB、解码 30 token/秒;AMD Ryzen AI Max 395+ 占用 434MB、解码 313 token/秒;Apple M5 Max 解码 564 token/秒。在单张 H100 上,高并发时输出吞吐可达 40,400 token/秒。
    在 Ertas 上微调 LFM2.5 350M 是免费的吗?
    是的。它在 T4 GPU 层级上训练,并且远低于免费套餐的 5B 参数上限。导出可选 GGUF 或 safetensors LoRA 适配器。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.