Fine-Tune LFM2.5 350M with Ertas
LFM2.5-350M 是 Liquid AI 的微型边缘模型,享有完整的 28 万亿 token 训练预算,在 BFCLv3 函数调用上取得 44.11。量化后导出体积为 229MB,在 iPhone 13 Mini 上仅占用 56MB,因此它是单次请求独立场景下工具调用与结构化抽取的首选。
LFM2.5 350M at a Glance
| 完整名称 | LFM2.5-350M |
|---|---|
| 开发方 | Liquid AI |
| 参数量 | 350M |
| 层数 | 16 层(10 个双门控卷积块 + 6 个 GQA 块) |
| 训练预算 | 28 万亿 token |
| 上下文长度 | 32,768 token |
| 词表大小 | 65,536 |
| 知识截止 | 2024 年年中 |
| 支持语言 | 英语、阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语、西班牙语 |
| 发布日期 | 2026 年 3 月 31 日 |
| 许可协议 | LFM Open License v1.0(lfm1.0) |
| 在 Ertas 上微调所需 GPU 层级 | T4 |
| 可在 Ertas 免费套餐上训练 | 是 |
| Q4_K_M 导出体积 | 229 MB |
| Ertas 镜像 | ErtasAI/LFM2.5-350M |
Overview
LFM2.5-350M 是 Liquid AI LFM2.5 家族中的中间规模,发布于 2026 年 3 月 31 日。它与 1.2B 共享完全相同的层结构:16 层,按 10 个双门控短程卷积块与 6 个分组查询注意力块划分,并享有同样的 28 万亿 token 预训练预算。两者的差别在于参数量,而 350M 拿到的是完整训练,而不是缩水版本。
这一点比听上去更重要。小模型通常相对其容量而言训练不足,因为算力预算往往跟着参数量走。把 28T token 的预算投在 350M 参数上,才能产出一个 IFEval 76.96 的模型,高于体量更大的 Gemma 3 1B(63.49)和 Qwen3.5-0.8B(59.94)。
函数调用分数是最亮眼的部分。BFCLv3 的 44.11 与 BFCLv4 的 21.86 让 350M 领先于 Granite 4.0-H-350M(43.07 和 13.28)、Qwen3.5-0.8B(35.08 和 18.70),并大幅领先于自家前代 LFM2-350M(22.95 和 12.29)。在临床结构化抽取基准 CaseReportBench 上,它取得 32.45,而 Qwen3.5-0.8B 为 13.83,Gemma 3 1B 为 2.28。
上下文窗口与家族其他成员一致,为 32,768 token,词表为 65,536。量化到 Q4_K_M 后导出体积为 229MB。在 iPhone 13 Mini 上通过 Cactus 引擎运行时占用 56MB,解码 88 token/秒,这样的占用可以直接放进一个移动应用,而不必展开一场关于下载体积的讨论。
Liquid 推荐将其用于数据抽取、结构化输出和工具使用,并建议避开知识密集型任务、编程、数学和创意写作。Ertas 目录收录的镜像地址为 `ErtasAI/LFM2.5-350M`。
Key Features
在 350M 参数上做函数调用,是选择这个模型的理由。BFCLv3 的 44.11 与 230M 相差不到一分,也接近许多 1B 级模型的水平,而一代之前的 LFM2-350M 在同一基准上只有 22.95。模型默认在 `<|tool_call_start|>` 与 `<|tool_call_end|>` token 之间写出 Python 式调用,也可通过系统提示词切换为 JSON。
结构化抽取是与之配套的强项。CaseReportBench 的 32.45 衡量的是从非结构化病例报告中提取结构化临床字段的能力,350M 的成绩是 Qwen3.5-0.8B(13.83)的两倍以上。再结合 IFBench 的 40.69,这描绘出一个能稳定产出你所要求格式的模型。
单一检查点的部署覆盖面异常之广。Liquid 公布了五个差异极大的目标上的实测:Apple M5 Max 通过 Mirai 解码 564 token/秒;AMD Ryzen AI Max 395+ 通过 llama.cpp 解码 313;iPhone 13 Mini 通过 Cactus 解码 88,占用 56MB;Snapdragon 8 Elite NPU 通过 RunAnywhere 占用 169MB;树莓派 5 解码 30 token/秒,占用 300MB。在单张 H100 上,高并发时输出吞吐可达 40,400 token/秒,也就是说同一个能装进树莓派的模型也能承担批量负载。
它覆盖九种语言:英语、阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语和西班牙语。多语言指令遵循基准 Multi-IF 的成绩是 44.92,高于 230M 的 37.70 和 Qwen3.5-0.8B 的 41.68。
规模的代价体现在:MMLU-Pro 20.01 与 GPQA Diamond 30.64。世界知识比较薄弱,这是 350M 参数下预期中的取舍。把事实放进提示词里。
Fine-Tuning with Ertas
LFM2.5 350M 在 Ertas Studio 的 T4 层级上微调,并且远低于免费套餐的 5B 参数上限。权重原生支持 bf16,训练直接以 bf16 进行,不会回退到 fp32。
适用于这个规模的配方是:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。在 350M 参数下,一次训练结束得足够快,你可以在一个下午里对数据集迭代好几轮,而真正的工作也正是在那里。
导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器。Q4_K_M 导出约为 229MB,而 Qwen 2.5 0.5B 为 490MB,Gemma 3 1B 为 810MB。如果你的产品需要把模型下发给用户,这个差距就是「用户直接接受」与「用户要考虑一下」之间的差距。
我们自己工作中的一个发现值得带上。在构建 [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 时,我们用同一份角色数据集分别微调了 350M 和 1.2B,并对两者跑了同一套评测。350M 完美保持了角色的语气与格式,产出的单句读起来完全对味。随后它跟丢了一段多轮随意对话的线索,回答了一个没有被问到的问题,还把同一个想法又重复了一遍,生怕你没看见。
让这件事代价高昂的是:所有自动化指标在两种规模上都是干净的。无破折号率、越狱泄漏率、句长分布、退化度和数字年龄泄漏全部通过。这个失败只有靠真正对话才看得见。如果你要为任何对话类用途微调 350M,请写一套脚本化的多轮探针,并在相信指标面板之前先跑一遍。而对于单轮抽取和工具调用(也正是这个模型的定位),这个风险并不适用。
Use Cases
大批量结构化数据抽取是最契合的场景。每份文档都是独立请求,事实来自模型面前的文本,关键在于每次都输出正确的格式。IFBench 的 40.69 与 CaseReportBench 的 32.45 都指向这一点,而在单张 H100 上 40,400 token/秒的输出吞吐,让跨大规模语料运行它在经济上完全成立。
边缘智能体中的工具调用是第二个场景。BFCLv3 的 44.11、原生 Python 式调用格式,以及可容纳工具定义的 32,768 token 上下文,意味着一个本地智能体可以在提示词中携带一套真实的工具集。搭配检索,让索引承担事实部分。
离线运行的移动应用功能与这个占用相称。iPhone 13 Mini 上 56MB 内存、229MB 下载体积,足够让分类、自动补全、设备端内容摘要和表单填充作为后台功能运行,而不必成为应用的主打卖点。
嵌入式与物联网部署在这里是现实可行的。Snapdragon 8 Elite NPU 上 169MB、树莓派 5 上 300MB,覆盖了大量无法舒适承载 1B 模型的硬件。
应当另寻他路的场景:多轮对话、角色类工作,以及任何需要世界知识、代码或数学的任务。若需要同家族中的对话深度,请上移到 [LFM2.5 1.2B](/models/lfm2-5-1-2b)。若在类似的单轮工作中需要更小的占用,[LFM2.5 230M](/models/lfm2-5-230m) 让出的能力少得出人意料。
Hardware Requirements
推理,依据 Liquid AI 在五个目标上的实测。Apple M5 Max 通过 Mirai:预填充 44,800 token/秒,解码 564,占用 1GB。AMD Ryzen AI Max 395+ 通过 llama.cpp:预填充 2,900,解码 313,占用 434MB。Snapdragon 8 Elite NPU 通过 RunAnywhere:预填充 2,800,解码 15,占用 169MB。iPhone 13 Mini 通过 Cactus 引擎:预填充 496,解码 88,占用 56MB。树莓派 5 通过 Cactus:预填充 200,解码 30,占用 300MB。在单张 H100 上,高并发时输出吞吐峰值为 40,400 token/秒。
导出体积,读取自 Liquid 公布的 GGUF 构建:Q4_0 为 219MB,Q4_K_M 为 229MB,Q5_K_M 为 260MB,Q6_K 为 293MB,Q8_0 为 379MB,BF16 为 712MB。在这个规模下值得试试 Q5_K_M 或 Q6_K,因为额外质量的绝对代价只有几十兆。
在 Ertas 上微调时,T4 层级绰绰有余。它是入门层级,也是免费套餐使用的层级。
如果在 Ertas 之外本地微调,350M 的 QLoRA 可装进 6GB 消费级 GPU,速度足以让几百行数据的一次完整训练在几分钟内跑完。
Frequently Asked Questions
- LFM2.5 350M 是什么?
- LFM2.5-350M 是 Liquid AI 于 2026 年 3 月 31 日发布的 3.5 亿参数设备端语言模型。它采用 16 层结构,按 10 个双门控卷积块与 6 个分组查询注意力块划分,上下文窗口为 32,768 token,预训练量为 28 万亿 token,与同家族的 1.2B 享有相同预算。
- LFM2.5 350M 的函数调用能力如何?
- 在 Liquid AI 公布的结果中,它的 BFCLv3 为 44.11,BFCLv4 为 21.86。这让它领先于 Granite 4.0-H-350M(43.07 和 13.28)、Qwen3.5-0.8B(35.08 和 18.70)、Gemma 3 1B IT(16.61 和 7.17),并约为自家前代 LFM2-350M(22.95 和 12.29)的两倍。函数调用是这个模型被设计来做好的两件事之一。
- 微调后的 LFM2.5 350M 导出文件有多大 ?
- 依据 Liquid AI 公布的 GGUF 构建,Q4_K_M 下约为 229MB。Q5_K_M 为 260MB,Q6_K 为 293MB,Q8_0 为 379MB。作为对比,Gemma 3 1B 在 Q4_K_M 下为 810MB,Qwen 2.5 0.5B 为 490MB。
- LFM2.5 350M 能维持对话吗?
- 单轮任务才是它的位置。在我们自己的测试中,微调后的 350M 完美保持了角色的语气与格式,随后却在多轮随意对话中跟丢了线索,对没有被问到的问题给出流畅且完全符合人设的回答。我们跑的所有自动化指标在 350M 和 1.2B 上都通过了,只有一套脚本化的对话探针才暴露出这个差别。对于抽取、分类、结构化输出和工具调用这类每次请求彼此独立的任务,350M 是很好的选择。若需要对话能力,请上移到 LFM2.5 1.2B。
- 什么硬件可以运行 LFM2.5 350M?
- Liquid AI 公布了五个目标上的实测:iPhone 13 Mini 占用 56MB、解码 88 token/秒;Snapdragon 8 Elite NPU 占用 169MB;树莓派 5 占用 300MB、解码 30 token/秒;AMD Ryzen AI Max 395+ 占用 434MB、解码 313 token/秒;Apple M5 Max 解码 564 token/秒。在单张 H100 上,高并发时输出吞吐可达 40,400 token/秒。
- 在 Ertas 上微调 LFM2.5 350M 是免费的吗?
- 是的。它在 T4 GPU 层级上训练,并且远低于免费套餐的 5B 参数上限。导出可选 GGUF 或 safetensors LoRA 适配器。
Supported Quantizations
Related Resources
LFM2.5 sizes compared: 230M vs 350M vs 1.2B on-device
Chatty Valley: an on-device AI mod for Stardew Valley (Part 1)
Fine-Tuned Tool Calling for n8n and Make.com Workflows
Edge AI in 2026: Why 80% of Inference Is Moving Local
llama.cpp
LM Studio
MLX
Ollama
OpenVINO
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.