Fine-Tune LFM2.5 with Ertas

    Liquid AI 的 LFM2.5 是一组面向设备端部署的混合架构语言模型,提供 230M、350M 和 1.2B 三种参数规模。它以双门控卷积块加分组查询注意力为骨干,而非纯 Transformer 堆叠。三者均支持 32,768 token 上下文窗口,运行内存低于 1GB,是 Ertas 目录中最小的基础模型。

    230M350M1.2BLiquid AI
    Ertas Studio 的 Add Model 对话框,LFM 分组下有三个条目:LFM2.5 1.2B、LFM2.5 230M 和 LFM2.5 350M,均标注为 Liquid AI,下方是 Llama 分组
    Ertas Studio 模型选择器中的三个 LFM2.5 规模。三者都可在 T4 上训练,并且都在免费套餐的 5B 参数上限之内。

    LFM2.5 at a Glance

    开发方Liquid AI
    Ertas 目录中的规模230M、350M、1.2B(实际 1.17B)
    架构混合架构:双门控短程卷积块 + 分组查询注意力(GQA)块
    上下文长度32,768 token(三种规模一致)
    词表大小65,536
    知识截止2024 年年中
    许可协议LFM Open License v1.0(lfm1.0)
    在 Ertas 上微调所需 GPU 层级三种规模均为 T4
    可在 Ertas 免费套餐上训练是,三种均可
    导出格式GGUF 与 safetensors LoRA 适配器
    Q4_K_M 导出体积153 MB(230M)、229 MB(350M)、731 MB(1.2B)
    对话模板类 ChatML,默认输出 Python 式工具调用

    Overview

    LFM2.5 是 Liquid AI 面向设备端部署打造的混合架构语言模型家族。Ertas 目录中收录了三种文本规模:LFM2.5-230M、LFM2.5-350M 和 LFM2.5-1.2B-Instruct。三者均为开放权重,均支持 32,768 token 的上下文窗口,并且都能在手机、笔记本或树莓派上以不足 1GB 的内存运行。

    真正把这个家族与目录中其他小模型区分开的是架构。LFM2.5 没有自上而下地堆叠 Transformer 块,而是将双门控短程卷积块与分组查询注意力块交错排列。1.2B 与 350M 均为 16 层,按 10 个卷积块比 6 个注意力块划分;230M 为 14 层,按 8 比 6 划分。卷积块相对序列长度是线性开销,而注意力是平方开销,因此这种混合结构让长提示词在小参数量下依然划算,而同等规模的纯 Transformer 此时已经开始为自身的注意力矩阵付出代价。

    这个家族在 2026 年分三次发布。LFM2.5-1.2B-Instruct 于 1 月 5 日与视觉、音频变体一同推出,预训练量相较上一代 LFM2 从 10T 扩展到 28T token。LFM2.5-350M 于 3 月 31 日跟进,沿用同样的 28T 预算。LFM2.5-230M 于 6 月 25 日发布,使用 19T token 训练并从 350M 蒸馏而来,随后经过直接偏好优化和多领域强化学习精调。

    Liquid 为每种规模提供原生 safetensors、GGUF、ONNX 和 MLX 版本,并为 Intel 硬件提供 OpenVINO 构建。许可协议为 LFM Open License v1.0,这是 Liquid 自有的协议文本,而不是 Apache 2.0 或 MIT。商用被允许但附带条件,因此在大规模发布前请先阅读。

    在 Ertas 上,三种规模都在 T4 上微调,并且都在免费套餐的 5B 参数上限之内。它们是我们收录的最小基础模型。如果你的目标是浏览器、手机或任何内存受限的设备,从这里起步比把更大的模型压缩下来再指望质量还在要更合理。

    Key Features

    指令遵循是这个家族最明显超出自身规模的地方。LFM2.5-1.2B-Instruct 在 IFEval 上取得 86.23,而参数量大 45% 的 Qwen3-1.7B 为 73.68,Llama 3.2 1B 为 52.37。在衡量更难约束遵循能力的 IFBench 上,差距进一步拉大到 47.33 对 21.33。对于一个每次请求都必须输出格式正确的工具调用或可解析 JSON 的模型来说,这个维度比记住多少知识更重要。

    工具调用是原生能力,而不是提示词工程的技巧。LFM2.5 默认在专用的 `<|tool_call_start|>` 与 `<|tool_call_end|>` token 之间写出 Python 式函数调用,你也可以通过系统提示词切换为 JSON 输出。350M 在 BFCLv3 上取得 44.11,230M 取得 43.26,两者相差不到一分,并且明显领先于前代 LFM2-350M 的 22.95。一个 230M 的模型能在函数调用基准上站稳脚跟,对这个参数量而言确实令人意外。

    内存占用是最具实操意义的亮点。Liquid 实测 350M 在 iPhone 13 Mini 上通过 Cactus 引擎占用 56MB,在 AMD Ryzen AI Max 395+ 上通过 llama.cpp 占用 434MB。230M 在 Galaxy S25 Ultra 上占用 375MB,解码速度 213 token/秒;在树莓派 5 上占用 293MB。1.2B 在 CPU、移动端和 NPU 目标上均保持在 1GB 以内。

    多语言覆盖比规模所暗示的更广,而且模型越小覆盖越宽。1.2B 覆盖八种语言,350M 九种,230M 十种(含意大利语)。三者共享 65,536 的词表,仅为 Gemma 3 的 256K 词表的四分之一,这也是导出体积如此之小的重要原因。在这个参数量级上,嵌入表在文件体积中占比很大,因此紧凑的词表会直接换来更小的下载体积。

    Fine-Tuning with Ertas

    三种 LFM2.5 规模都在 Ertas Studio 的 T4 层级上微调,这是入门 GPU 层级,并且三者都在免费套餐的 5B 参数上限之内。你可以零成本训练 1.2B。这些模型原生支持 bf16,因此直接以 bf16 训练,无需像 Gemma 3 在 Turing 硬件上那样回退到 fp32。

    对这么小的家族而言,行之有效的配方是比 7B 模型更高的学习率和更多的轮次。Ertas 针对 2B 以下基础模型的训练建议是:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 个轮次。小模型需要在数据上多走几遍行为才会稳定下来,而且能承受这种较激进的学习率而不崩溃。

    导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器(如果你希望把适配器单独保留、自行合并)。微调后的 230M 在 Q4_K_M 下约 153MB,350M 约 229MB,1.2B 约 731MB。这些下载体积可以直接呈现给终端用户,无需额外解释。

    Ertas 有两个基于这个家族的线上项目。[Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 是 LFM2.5-1.2B-Instruct 的微调版本,为《星露谷物语》中的一位村民生成对话,量化到 Q4_K_M 后为 697MB,完全运行在玩家自己的 CPU 上,无需 API 密钥。Corporate Goblin 是 LFM2.5-230M 的 LoRA 微调版本,合并后导出为 q4 ONNX,通过 transformers.js 与 WebGPU 完全在浏览器中运行,地址是 [playground.ertas.ai](https://playground.ertas.ai)。两者分别覆盖了这个家族的两端,也覆盖了两条导出路径。

    开始之前唯一需要知道的是:LFM Open License v1.0 会随着你的微调模型一起传递。它是 Liquid AI 自有条款的协议文本,因此基于 LFM2.5 构建的商业产品需要真正读一遍这份协议,而不是想当然。

    Use Cases

    数据抽取与结构化输出是 Liquid 为这个家族每种规模都优先推荐的场景,基准表现也支持这一点。高 IFEval 与 IFBench 搭配中等的 MMLU-Pro,描述的是一个能可靠遵循指令形态、但对世界了解较少的模型,而这正是把文档转成 JSON 时你想要的取舍。事实来自文档本身。

    设备端智能体与工具调用是第二个场景。Liquid 推荐 1.2B 用于智能体任务和 RAG,230M 则定位于轻量级设备端智能体流水线。一个在手机上以 213 token/秒输出正确函数调用、且数据完全不出设备的模型,打开了云端往返在延迟或成本上不划算的助手形态。

    浏览器端 AI 是 230M 尤其能立足的地方。量化后 153MB 是一个合理的首次加载体积,导出为 ONNX 后可通过 transformers.js 在 WebGPU 上运行,并以 WASM 兜底。Corporate Goblin 正是如此:一个下载到用户机器上并在本地运行的角色模型,无服务器,无按次调用成本。

    游戏与角色 AI 是 Chatty Valley 验证过的模式:一个明确的人设、一份精炼的数据集,以及一个小到玩家愿意下载的模型。1.2B 能在多轮对话中保持角色;350M 能保住语气却会跟丢话题,这个结论值得在选型之前读一读。

    应当避开的场景:Liquid 明确不推荐这个家族用于知识密集型任务和编程,230M 的模型卡还把高级数学和创意写作也列入其中。230M 在 MMLU-Pro 上的 20.25 对比 Qwen3.5-0.8B 的 37.42,就是原因所在。如果你的任务需要模型知道很多事情而不是做很多事情,请看更大的基础模型。

    Hardware Requirements

    推理占用,均为 Liquid AI 在具名硬件上的实测数据。230M 在 Galaxy S25 Ultra 上占用 375MB,预填充 1,158 token/秒,解码 213 token/秒;在树莓派 5 上以 4-bit 量化、2K 上下文运行时占用 293MB,预填充 523,解码 42。350M 在 iPhone 13 Mini 上通过 Cactus 引擎占用 56MB,预填充 496,解码 88;在 Snapdragon 8 Elite NPU 上占用 169MB;在 AMD Ryzen AI Max 395+ 上占用 434MB,解码 313 token/秒。1.2B 在 Galaxy S25 Ultra 上占用 719MB,而同一设备上的 Qwen3-1.7B 需要 1,306MB;在 AMD Ryzen AI 9 HX 370 上占用 856MB。

    Q4_K_M 导出体积,读取自 Liquid 公布的 GGUF 构建:230M 为 153MB,350M 为 229MB,1.2B 为 731MB。Q8_0 下分别为 247MB、379MB 和 1.25GB。完整 BF16 权重分别为 462MB、712MB 和 2.34GB。

    在 Ertas 上微调时,三种规模都在 T4 层级训练,这是入门层级,也是免费套餐使用的层级。这个家族的任何规模都不需要动用 A10G,而原生 bf16 权重意味着在 Turing 硬件上不会有回退 fp32 的性能损失。

    如果你在本地而非 Ertas 上训练,230M 和 350M 的 QLoRA 可以轻松装进 6GB 的消费级 GPU,1.2B 则需要 8GB 或以上。在这个规模下,单步训练速度足够快,真正的瓶颈会变成数据集的迭代,而不是等待训练完成。

    Frequently Asked Questions

    LFM2.5 是什么?
    LFM2.5 是 Liquid AI 推出的开放权重混合架构语言模型家族,面向设备端部署,提供 230M、350M 和 1.2B 三种参数规模,均支持 32,768 token 的上下文窗口。它没有采用纯 Transformer 堆叠,而是将双门控短程卷积块与分组查询注意力块交错排列,从而在较小参数量下依然能以较低成本处理长序列推理。
    LFM2.5 支持多长的上下文?
    三种 LFM2.5 文本规模均支持 32,768 token。230M 是在其 19T token 预训练过程中,通过专门的 32K 上下文扩展阶段达到这一长度的。
    我应该选择哪种 LFM2.5 规模?
    当模型需要维持多轮对话或运行智能体循环时,选择 1.2B。当每次请求彼此独立时(例如工具调用、数据抽取和结构化输出),选择 350M。当下载体积是决定性约束时选择 230M,例如浏览器内的模型,或者整体下载预算只有两三百兆的手机应用。
    我们自己的经验是:微调后的 350M 能完美保持角色的语气与格式,但在几轮之后就会跟丢一段随意对话的线索,而 1.2B 能跟住。我们跑的所有自动化指标都显示 350M 没有问题,只有一套脚本化的对话探针才发现了它。
    LFM2.5 可以免费商用吗?
    LFM2.5 依据 LFM Open License v1.0 发布,这是 Liquid AI 自有的许可协议,而非 Apache 2.0 或 MIT。商用被允许但附带条件。由于其条款与常见的宽松许可不同,在基于 LFM2.5 发布商业产品前请先阅读该协议。该协议会随你的微调模型一起传递。
    可以在 Ertas 免费套餐上微调 LFM2.5 吗?
    可以。三种 LFM2.5 规模都在免费套餐的 5B 参数上限之内,并且都在 T4 GPU 层级上训练。1.2B 是这个家族中最大的,同样可以免费训练。
    微调后的 LFM2.5 导出文件有多大?
    在 Q4_K_M 下,230M 约 153MB,350M 约 229MB,1.2B 约 731MB。Ertas 支持导出为供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,或导出为 safetensors LoRA 适配器。Chatty Valley 发布的 1.2B 导出文件为 697MB。
    LFM2.5 不擅长什么?
    Liquid AI 不推荐这个家族用于知识密集型任务和编程,并针对 230M 额外列出了高级数学和创意写作。基准表现说明了原因:LFM2.5-230M 在 MMLU-Pro 上为 20.25,而 Qwen3.5-0.8B 为 37.42。这些模型擅长遵循指令和调用工具,但对世界的了解相对有限,因此请为它们搭配检索,而不是让它们凭记忆回答事实性问题。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.