LFM2.5 规模对比:设备端 230M、350M 与 1.2B
Liquid AI 的 LFM2.5 提供三种规模。基准数据、导出体积,以及我们把其中两种微调成正式产品时学到的东西,包括那个所有指标都没能发现的失败。
Liquid AI 的 LFM2.5 家族现已进入 Ertas 目录,共三种规模:230M、350M 和 1.2B。三者均为开放权重,均支持 32,768 token 的上下文窗口,运行内存都不到 1GB,并且都能在我们的入门 GPU 层级上、于免费套餐范围内完成训练。
它们都能用。真正有意思的问题是你应该选哪一个,而这件事的答案比大多数模型对比都更干净。
简短版本: 如果模型需要维持对话,选 1.2B。如果每次请求彼此独立,选 350M 或 230M。它们之间的分界线是对话连贯性,而这条线比基准分数所暗示的要清晰得多。
| 如果你的模型需要 | 选择 | Q4_K_M 下载体积 |
|---|---|---|
| 维持多轮对话、运行智能体循环 | LFM2.5 1.2B | 731 MB |
| 调用工具、抽取字段、输出 JSON,每次一个请求 | LFM2.5 350M | 229 MB |
| 在浏览器标签页或树莓派里完成上述这些 | LFM2.5 230M | 153 MB |
| 知道很多世界知识 | 更大的模型 | 不适用 |

这个架构只有一部分是 Transformer
LFM2.5 将双门控短程卷积块与分组查询注意力块交错排列。1.2B 与 350M 均为 16 层,按 10 个卷积块比 6 个注意力块划分。230M 为 14 层,按 8 比 6 划分。
这种划分就是整个设计的核心。注意力相对序列长度是平方开销,卷积是线性开销。把两者混合,就能让长提示词在小参数量下依然划算,而同等规模的纯 Transformer 此时已经开始为自身的注意力矩阵付出代价。这也是为什么一个 230M 的模型能承载 32,768 token 的上下文,以及为什么这些模型在 CPU 上仍能保持吞吐,而同等规模的 Transformer 会明显吃力。
整个家族的词表为 65,536 token,仅为 Gemma 3 的 256K 词表的四分之一。在这个参数量级上,嵌入表在文件体积中占比很大,因此紧凑的词表几乎完全解释了为什么一个 1.17B 的模型导出后比 Gemma 3 1B 还小。
三种规模并排对比
| LFM2.5 230M | LFM2.5 350M | LFM2.5 1.2B | |
|---|---|---|---|
| 参数量 | 230M | 350M | 1.17B |
| 层数 | 14(8 卷积 + 6 GQA) | 16(10 卷积 + 6 GQA) | 16(10 卷积 + 6 GQA) |
| 预训练预算 | 19T token | 28T token | 28T token |
| 上下文长度 | 32,768 | 32,768 | 32,768 |
| 语言数 | 10 | 9 | 8 |
| 发布日期 | 2026 年 6 月 25 日 | 2026 年 3 月 31 日 | 2026 年 1 月 5 日 |
| Ertas GPU 层级 | T4 | T4 | T4 |
| 免费套餐 | 是 | 是 | 是 |
这张表里有两件事值得停下来看看。
350M 拿到了与 1.2B 相同的 28 万亿 token 训练预算。小模型通常相对其容量而言训练不足,因为算力预算往往跟着参数量走。把一次完整规模的训练投在 350M 参数上是一个刻意的选择,而这在分数上体现了出来。
230M 是从 350M 蒸馏而来的,而不是在那个规模上从零训练,随后又经过直接偏好优化和多领域强化学习精调。它覆盖的语言也是三者中最多的,多出了意大利语。
基准数据
以下所有数字均为 Liquid AI 公布的结果,来自 LFM2.5 发布文章、350M 文章 和 230M 文章。1.2B 的对比对象与两个更小的 型号不同,因此两张表分开呈现。
LFM2.5-1.2B-Instruct 对比 1B 至 1.7B 区间:
| 基准 | LFM2.5 1.2B | Qwen3-1.7B | Granite-4.0-h-1b | Gemma 3 1B | Llama 3.2 1B |
|---|---|---|---|---|---|
| IFEval | 86.23 | 73.68 | 80.08 | 63.25 | 52.37 |
| IFBench | 47.33 | 21.33 | 24.93 | 20.47 | 15.93 |
| MMLU-Pro | 44.35 | 42.91 | 27.64 | 14.04 | 20.80 |
| GPQA | 38.89 | 34.85 | 24.34 | 24.24 | 16.57 |
| AIME25 | 14.00 | 9.33 | 1 | 1 | 0.33 |
LFM2.5-230M 与 350M 对比 1B 以下区间:
| 基准 | LFM2.5 230M | LFM2.5 350M | LFM2-350M | Granite 4.0-H-350M | Qwen3.5-0.8B | Gemma 3 1B IT |
|---|---|---|---|---|---|---|
| IFEval | 71.71 | 76.96 | 64.96 | 61.27 | 59.94 | 63.49 |
| IFBench | 38.40 | 40.69 | 18.20 | 17.22 | 22.87 | 20.33 |
| Multi-IF | 37.70 | 44.92 | 32.92 | 28.70 | 41.68 | 44.25 |
| BFCLv3 | 43.26 | 44.11 | 22.95 | 43.07 | 35.08 | 16.61 |
| BFCLv4 | 21.03 | 21.86 | 12.29 | 13.28 | 18.70 | 7.17 |
| CaseReportBench | 22.51 | 32.45 | 11.67 | 12.44 | 13.83 | 2.28 |
| MMLU-Pro | 20.25 | 20.01 | 19.29 | 13.14 | 37.42 | 14.04 |
| GPQA Diamond | 25.41 | 30.64 | 27.58 | 22.32 | 27.41 | 23.89 |
两张表的形态是一样的。指令遵循和函数调用的分数对这个参数量而言异常之高,世界知识的分数则平平甚至更差。Qwen3.5-0.8B 以明显优势拿下 MMLU-Pro,却在所有指令遵循的列上落后。
这就是整个家族做出的取舍,而对设备端场景来说这个取舍是对的。一个能可靠照你说的做、事实由提示词提供的模型,胜过一个知道更多但更不听话的模型。给它们配上检索,让索引去承担知识。


另一个值得细看的数字:230M 在 BFCLv3 上取得 43.26,而它 350M 的教师模型为 44.11。蒸馏几乎原封不动地把函数调用能力带下了整整一个规模 档位。参数量约为其四倍的 Gemma 3 1B IT,在同一基准上只有 16.61。
我们真正做过的那场对比
基准把我们缩小到了一个候选名单,但在 350M 和 1.2B 之间做决定,需要真的做一个东西出来。
Chatty Valley 是一个《星露谷物语》模组,用一个运行在玩家自己 CPU 上的微调模型替换了某位村民固定的台词。我们用同一份角色数据集分别训练了 350M 和 1.2B,并对两者跑了同一套评测。
我本来希望 350M 能赢。让一个陌生人下载 229MB 远比 731MB 来得容易开口,而且微调后的 350M 把角色的语气和格式保持得非常好,产出的单句读起来完全就是那个角色。
然后它就跟丢了。问它一句随意又略带混乱的话,你会得到流畅、完全符合人设的胡言乱语:一个针对你没问过的问题的回答,紧接着同一个想法再重复一遍,生怕你没看见。1.2B 能跟住对话,所以最终发布的是它,量化后 697MB。
下面这一点值得带进你自己的项目。所有自动化指标都说 350M 没问题。 无破折号率、越狱泄漏率、句长分布、退化度、数字年龄泄漏,在两种规模上全部干净。这个失败只有靠真正对话才看得见。
所以,如果你要在这个量级上微调任何对话类应用,请写一套脚本化的多轮探针,复现你真正在意的那种对话形态,并在相信指标面板之前先跑一遍。自动化维度能抓住回归,却看不见连贯性。
对于单轮任务,也就是 350M 和 230M 真正的定位,上面这些都不适用。抽取、分类、结构化输出和工具调用都是彼此独立的请求,两个较小的规模都处理得很好。
一个能在浏览器标签页里运行的 230M 模型
230M 靠下载体积赢得自己的位置。量化后 153MB,小到可以在一个网页里下载完成。
Corporate Goblin 就是我们的演示:LFM2.5-230M 的 LoRA 微调版本,合并后导出为 q4 ONNX,通过 transformers.js 在 WebGPU 上完全跑在客户端,并以 WASM 兜底。没有服务器,没有 API 密钥,没有按次调用成本,你输入的任何内容都不会离开访问者的机器。它把每个提示词都当作一位过分自信的增长大师来回答,并拒绝提供任何有用信息,而这正是它的用意。
它认真证明的一点是:只要任务足够窄、数据集在这一点上足够一致,一个 230M 的模型守住一个明确人设的能力远超参数 量给人的印象。当任务足够具体时,小模型是真的能打的。
每种规模的发布成本
下载体积是决定大多数设备端项目的约束条件,所以这里给出真实数字,读取自 Liquid AI 公布的 GGUF 构建,而不是估算。
| 量化 | 230M | 350M | 1.2B |
|---|---|---|---|
| Q4_0 | 149 MB | 219 MB | 696 MB |
| Q4_K_M | 153 MB | 229 MB | 731 MB |
| Q5_K_M | 172 MB | 260 MB | 843 MB |
| Q6_K | 191 MB | 293 MB | 963 MB |
| Q8_0 | 247 MB | 379 MB | 1.25 GB |
| BF16 | 462 MB | 712 MB | 2.34 GB |
在两个较小的规模上,从 Q4_K_M 提到 Q6_K 分别只多 38MB 和 64MB。这个代价低到值得先测一测额外的质量对你的任务是不是几乎免费,再决定要不要默认用 Q4。


运行占用,均为 Liquid AI 在具名硬件上的实测:
| 设备 | 模型 | 内存 | 解码 |
|---|---|---|---|
| iPhone 13 Mini(Cactus) | 350M | 56 MB | 88 token/秒 |
| Snapdragon 8 Elite NPU | 350M | 169 MB | 15 token/秒 |
| 树莓派 5 | 230M | 293 MB | 42 token/秒 |
| Galaxy S25 Ultra | 230M | 375 MB | 213 token/秒 |
| AMD Ryzen AI Max 395+ | 350M | 434 MB | 313 token/秒 |
| Galaxy S25 Ultra | 1.2B | 719 MB | 70 token/秒 |
| AMD Ryzen AI 9 HX 370 | 1.2B | 856 MB | 116 token/秒 |
作为参照,在 1.2B 占用 719MB 的同一台 Galaxy S25 Ultra 上,Qwen3-1.7B 需要 1,306MB。
在 Ertas 上微调 LFM2.5
三种规模都在 T4 层级上训练,这是我们的入门层级,也是免费套餐使用的层级。三者都在免费套餐的 5B 参数上限之内,因此即便是其中最大的那个,完整训练也可以零成本开始。权重原生支持 bf16,训练直接以 bf16 进行,没有回退 fp32 的性能损失。
适用于 2B 以 下基础模型的配方:
| 设置 | 取值 |
|---|---|
| 学习率 | 3e-4 到 5e-4 |
| 批大小 | 4 |
| 梯度累积 | 2 |
| 训练轮次 | 8 到 16 |
相比 7B 模型,小模型需要在小数据集上多走几遍行为才会稳定下来,并且能承受更高的学习率而不崩溃。
导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器(如果你希望把适配器单独保留、自行合并)。若用于浏览器部署,请把适配器合并后转换为 q4 ONNX,这正是 Corporate Goblin 走的路径。
有一件事需要提前规划:这个家族的工具调用默认使用包裹在专用 <|tool_call_start|> 与 <|tool_call_end|> token 之间的 Python 式函数调用。如果你的运行时期望 JSON,可以在系统提示词里要求。请让训练数据与你打算发布的形式保持一致。
发布前关于许可的一个提醒
LFM2.5 依据 LFM Open License v1.0 发布,这是 Liquid AI 自有的协议文本。商用被允许但附带条件,其条款与 Apache 2.0 或 MIT 不同。该协议会随你的微调模型一起传递,因此在基于这一基础模型发布商业产品前请先阅读。Ertas 目录中的其余模型大多是 Apache 2.0,很容易让人以为这个也一样。
常见问题
LFM2.5 230M、350M 和 1.2B 有什么区别?
它们共享同一架构和 32,768 token 的上下文窗口,差别在容量。1.2B 能维持多轮对话和智能体循环。350M 在函数调用和结构化 抽取上紧追 1.2B,而下载体积只有三分之一。230M 由 350M 蒸馏而来,在工具调用上让出的很少,同时能塞进 153MB,小到足以放进浏览器。
微调聊天机器人应该选哪种 LFM2.5 规模?
1.2B。在我们自己的测试中,微调后的 350M 完美保持了角色的语气,随后却在多轮随意对话中跟丢了线索,而 1.2B 跟住了。所有自动化指标在两种规模上都通过了,因此这个差别只有通过脚本化的对话探针才浮现出来。
LFM2.5 能在网页浏览器里运行吗?
可以。导出为 ONNX、量化到 q4,然后通过 transformers.js 在 WebGPU 上运行,并以 WASM 兜底。153MB 的 230M 是首次加载的实用选择。playground.ertas.ai 上的 Corporate Goblin 就是一个可用的例子。
在这个规模上 LFM2.5 比 Qwen 或 Gemma 更好吗?
在指令遵循和函数调用上,明显更好。LFM2.5-1.2B 的 IFEval 为 86.23,Qwen3-1.7B 为 73.68,Gemma 3 1B 为 63.25;LFM2.5-350M 的 BFCLv3 为 44.11,Gemma 3 1B IT 为 16.61。在世界知识上它会输:Qwen3.5-0.8B 的 MMLU-Pro 为 37.42,而 230M 为 20.25。按你的任务真正需要哪一项来选。
微调 LFM2.5 要花多少钱?
起步不花钱。三种规模都在 Ertas 免费套餐的 5B 参数上限之内,并在 T4 层级上训练。付费层级增加了什么,请参见价格页面。
LFM2.5 不擅长什么?
Liquid AI 不推荐这个家族用于知识密集型任务和编程,并针对 230M 额外列出了高级数学和创意写作。多轮对话是两个较小规模的另一个边界。请把事实放进提示词里,并给这些模型一个具体的任务。
包含完整规格、基准与硬件需求的模型 页面:LFM2.5 家族、LFM2.5 230M、LFM2.5 350M、LFM2.5 1.2B。
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.
Keep reading
Chatty Valley:星露谷物语的端侧 AI 对话模组(第一部分)
我微调了一个 1.2B 端侧 AI 模型,让星露谷物语里的莱纳斯能真正跟你聊天。模型随模组本地跑在你的 CPU 上,不需要 API key。这是 Chatty Valley 开发日志的第一部分。
微调3B vs GPT-4:为什么小模型在领域任务上更胜一筹
学术研究表明,微调的3B-7B模型在领域特定任务上持续击败GPT-4。以下是证据、规律,以及如何在你的应用中实践。
运行时感知的数据准备:为什么你的管道应该知道模型将在哪里运行
当前 AI 管道假设先训练后部署。对于端侧 AI,工作流是教师模型 → 蒸馏 → 量化 → 运行时约束。理解目标运行时的数据准备能产生从根本上更好的模型。