Fine-Tune LFM2.5 230M with Ertas
LFM2.5-230M 是 Ertas 目录中最小的基础模型,由 LFM2.5-350M 蒸馏而来,在 BFCLv3 函数调用上取得 43.26。量化后导出体积为 153MB,在树莓派 5 上仅占用 293MB,因此当下载体积本身就是约束条件时,它就是应当选择的模型。
LFM2.5 230M at a Glance
| 完整名称 | LFM2.5-230M |
|---|---|
| 开发方 | Liquid AI |
| 参数量 | 230M |
| 层数 | 14 层(8 个双门控卷积块 + 6 个 GQA 块) |
| 训练预算 | 19 万亿 token,含 32K 上下文扩展阶段 |
| 后训练 | 由 LFM2.5-350M 蒸馏,随后经 DPO 与多领域强化学习 |
| 上下文长度 | 32,768 token |
| 词表大小 | 65,536 |
| 知识截止 | 2024 年年中 |
| 支持语言 | 英语、阿拉伯语、中文、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语 |
| 发布日期 | 2026 年 6 月 25 日 |
| 许可协议 | LFM Open License v1.0(lfm1.0) |
| 在 Ertas 上微调所需 GPU 层级 | T4 |
| 可在 Ertas 免费套餐上训练 | 是 |
| Q4_K_M 导出体积 | 153 MB |
| Ertas 镜像 | ErtasAI/LFM2.5-230M |
Overview
LFM2.5-230M 是 Liquid AI LFM2.5 家族中最小的模型,也是 Ertas 目录中最小的基础模型。它发布于 2026 年 6 月 25 日,采用 14 层结构,按 8 个双门控短程卷积块与 6 个分组查询注意力块划分,比更大的同门少两个卷积块,预训练量为 19 万亿 token,其中包含一个专门的 32K 上下文扩展阶段。
它是蒸馏出来的,而不是在这个规模上从零训练的。Liquid 先做了从 LFM2.5-350M 蒸馏的监督微调,然后是直接偏好优化,再然后是多领域强化学习。正是这条流水线,让一个 230M 的模型在函数调用上逼近它 350M 的教师模型:BFCLv3 为 43.26 对 44.11,BFCLv4 为 21.03 对 21.86。
与规模相近的其他模型相比,结果同样站得住。IFEval 上它取得 71.71,而体量明显更大的 Gemma 3 1B IT 为 63.49、Qwen3.5-0.8B 为 59.94。IFBench 上为 38.40 对 20.33 和 22.87。BFCLv3 上为 43.26,Gemma 3 1B IT 为 16.61。CaseReportBench 上为 22.51 对 2.28。
语言覆盖是家族中最广的,共十种:英语、阿拉伯语、中文、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语。上下文窗口与 350M 和 1.2B 一致,为 32,768 token,词表为 65,536。
量化到 Q4_K_M 后导出体积为 153MB。这个数字就是这个模型存在的全部意义:它小到可以在网页里下载完成,小到可以打包进移动应用而不必讨论体积,也小到可以和树莓派上正在跑的其他东西共处。Liquid 推荐将其用于数据抽取和轻量级设备端智能体流水线,并建议避开推理密集型工作:高级数学、代码生成和创意写作。Ertas 目录收录的镜像地址为 `ErtasAI/LFM2.5-230M`。
Key Features
在 230M 参数上守住 BFCLv3 43.26,是最值得说的一点。它 350M 的教师模型为 44.11,Granite 4.0-H-350M 为 43.07,也就是说蒸馏几乎把全部函数调用能力带下了一个规模档位。参数量约为其四倍的 Gemma 3 1B IT,在同一基准上只有 16.61。
指令遵循比世界知识更能挺过这次缩小。IFEval 的 71.71 与 IFBench 的 38.40 都接近 350M 的 76.96 和 40.69。规模的代价体现在 MMLU-Pro 的 20.25 和 GPQA Diamond 的 25.41 上,而 Qwen3.5-0.8B 以 37.42 拿下 MMLU-Pro。这个分化正是理解这个模型的关键:它照你说的做,但知道的相对不多,所以把事实放进提示词里。
部署数据是目录中其他模型无法企及的。在 Samsung Galaxy S25 Ultra 上占用 375MB,预填充 1,158 token/秒,解码 213 token/秒。在树莓派 5 上以 4-bit 量化、2K 上下文运行时占用 293MB,预填充 523,解码 42。在 H100 上,512 token 的提示词在并发为 1 时约 50ms 完成,并发为 64 时约 205ms。
在这个规模下,浏览器部署是真正可行的。导出为 ONNX 并量化到 q4 之后,模型可通过 transformers.js 加载并在 WebGPU 上运行,以 WASM 兜底,这意味着一个无服务器、无按次调用成本的 AI 功能。[playground.ertas.ai](https://playground.ertas.ai) 上的 Corporate Goblin 正是如此:它是这一基础模型的 LoRA 微调版本,合并后导出为 q4 ONNX,完全运行在访问者自己的机器上。
Fine-Tuning with Ertas
LFM2.5 230M 在 Ertas Studio 的 T4 层级上微调,是目录中训练成本最低的模型。它原生支持 bf16,因此直接以 bf16 训练。免费套餐可以轻松覆盖它。
适用于这个规模的配方是:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。在 230M 参数下,几百行数据的一次训练结束得足够快,以至于训练步骤不再是你等待的对象,数据集质量成为唯一真正重要的变量。
导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器。Q4_K_M 导出约为 153MB。若用于浏览器部署,可将适配器合并后转换为 q4 ONNX 供 transformers.js 使用。
Corporate Goblin 是我们自己的实例。它是 LFM2.5-230M 的 LoRA 微调版本,被训练成对任何提示词都以同一个固定人设作答,拒绝正常回答并以角色口吻岔开话题。它运行在 [playground.ertas.ai](https://playground.ertas.ai) 的浏览器中,访问者的任何输入都不会离开设备。它留下的经验是:只要任务足够窄、数据集在这一点上足够一致,一个 230M 的模型守住一个明确人设的能力远超参数量给人的印象。
需要提前规划的约束是对话记忆。这么小的模型在每次请求彼此独立时状态最好。如果你的微调需要模型跨多轮跟踪状态,请尽早写一套脚本化的多轮探针,并对着真实对话运行它,而不是依赖单轮指标。在我们对同家族的测 试中,自动化维度在一个其实跟不住话题的规模上依然干净,只有对话才把问题暴露出来。
Use Cases
浏览器端 AI 是这个模型解锁的场景。量化后 153MB 是一个合理的首次加载体积,通过 transformers.js 在 WebGPU 上完全跑在客户端。这一步同时移除了服务器、按次调用成本和隐私讨论,也因此改变了什么东西值得做。
大规模数据抽取是 Liquid 自己的首要推荐。每份文档都是独立请求,答案来自文本,模型的工作是产出一致的格式。在 H100 上 512 token 提示词约 50ms 的延迟下,把它跑遍一个大型语料的成本低到不值得单列成一项开销。
轻量级设备端智能体在这个规模下可行,因为函数调用能力挺过了蒸馏。BFCLv3 的 43.26 加上原生 Python 式调用格式,意味着一个本地智能体能从一组不大的工具中选对工具,而这往往就是嵌入式助手需要做的全部。
嵌入式与物联网部署是现实可行的。树莓派 5 上 293MB、解码 42 token/秒,覆盖了从智能家居设备到工业传感器再到自助终端的一大类硬件,而 1B 模型在这些地方会很吃力。
常驻型移动功能同样与这个占用相称。后台分类、设备端搜索排序、自动补全和内容归类可以在 375MB 下持续运行,而更大模型的内存与电量代价会直接排除这种做法。
应当另寻他路的场景:多轮对话、代码生成、数学、创意写作,以及任何需要世界知识的任务。Liquid 直接这么说,MMLU-Pro 的 20.25 就是背后的数字。若需要同家族中的对话能力,[LFM2.5 1.2B](/models/lfm2-5-1-2b) 才是能跟住话题的规模。
Hardware Requirements
推理,依据 Liquid AI 的实测数据。搭载 Snapdragon Gen4 的 Samsung Galaxy S25 Ultra:预填充 1,158 token/秒,解码 213 token/秒,内存 375MB。树莓派 5,4-bit 量化、2K 上下文:预填充 523,解码 42,占用 293MB。在单张 H100 上以 512 token 输入、32 token 输出批量服务时,并发为 1 时 p50 延迟约 50ms,并发为 64 时约 205ms。
导出体积,读取自 Liquid 公布的 GGUF 构建:Q4_0 为 149MB,Q4_K_M 为 153MB,Q5_K_M 为 172MB,Q6_K 为 191MB,Q8_0 为 247MB,BF16 为 462MB。在这个规模下,从 Q4_K_M 提到 Q6_K 只多 38MB,因此值得测一测额外的质量在实际中是不是几乎免费。
在 Ertas 上微调时,T4 层级绰绰有余。它是入门层级,也是免费套餐使用的层级。
如果在 Ertas 之外本地微调,230M 的 QLoRA 几乎能装进任何现代消费级 GPU,包括 6GB 显卡和许多近期的笔记本。这个规模的训练通常以分钟计,而不是小时。
Frequently Asked Questions
- LFM2.5 230M 是什么?
- LFM2.5-230M 是 Liquid AI 于 2026 年 6 月 25 日发布的最小设备端语言模型。它拥有 2.3 亿参数、14 层结构,混合了 8 个双门控卷积块与 6 个分组查询注意力块,上下文窗口为 32,768 token。它以 19 万亿 token 预训练,随后由 LFM2.5-350M 蒸馏而来,并经直接偏好优化与多领域强化学习精调。
- 230M 的模型真的能做函数调用吗?
- 可以。在 Liquid AI 公布的结果中,LFM2.5-230M 的 BFCLv3 为 43.26,BFCLv4 为 21.03。它 350M 的教师模型为 44.11 和 21.86,也就是说蒸馏保留了几乎全部能力。作为对比,参数量约为其四倍的 Gemma 3 1B IT 在 BFCLv3 上只有 16.61。
- 微调后的 LFM2.5 230M 导出文件有多大?
- 依据 Liquid AI 公布的 GGUF 构建,Q4_K_M 下约为 153MB。Q5_K_M 为 172MB,Q6_K 为 191MB,Q8_0 为 247MB。这是 Ertas 从目录中任何基础模型产出的最小导出文件。
- LFM2.5 230M 能在网页浏览器里运行吗?
- 可以。导出为 ONNX 并量化到 q4 之后,它通过 transformers.js 在 WebGPU 上于客户端运行,并以 WASM 兜底。playground.ertas.ai 上的 Corporate Goblin 就是这一基础模型的 LoRA 微调版本在做这件事,全程无服务器参与,访问者输入的任何内容都不会离开其设备。
- LFM2.5 230M 不适合做什么?
- Liquid AI 不推荐将其用于推理密集型负载:高级数学、代码生成和创意写作。另一个需要提前规划的边界是多轮对话,因为这个规模的模型在每次请求彼此独立时状态最好。MMLU-Pro 上 20.25 对 Qwen3.5-0.8B 的 37.42 直接显示了世界知识的差距,因此请为它搭配检索,而不是让它凭记忆回答事实性问题。
- 在 Ertas 上微调 LFM2.5 230M 是免费的吗?
- 是的。以 2.3 亿参数计,它是目录中最小、训练成本最低的基础模型,在 T4 GPU 层级上训练,并且远低于免费套餐的 5B 参数上限。
Supported Quantizations
Related Resources
LFM2.5 sizes compared: 230M vs 350M vs 1.2B on-device
Fine-Tuning for Indie Devs: Inside the $10 Ertas Lite Plan
Edge AI in 2026: Why 80% of Inference Is Moving Local
Best Models for On-Device Mobile AI in 2026
Hugging Face
llama.cpp
LM Studio
MLX
Ollama
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.