Back to blog
    lfm2.5liquid-aion-device-aismall-modelsfine-tuningmodel-comparisonedge-ai

    LFM2.5 规模对比:设备端 230M、350M 与 1.2B

    Liquid AI 的 LFM2.5 提供三种规模。基准数据、导出体积,以及我们把其中两种微调成正式产品时学到的东西,包括那个所有指标都没能发现的失败。

    Edward Xi Yang

    Liquid AI 的 LFM2.5 家族现已进入 Ertas 目录,共三种规模:230M、350M 和 1.2B。三者均为开放权重,均支持 32,768 token 的上下文窗口,运行内存都不到 1GB,并且都能在我们的入门 GPU 层级上、于免费套餐范围内完成训练。

    它们都能用。真正有意思的问题是你应该选哪一个,而这件事的答案比大多数模型对比都更干净。

    简短版本: 如果模型需要维持对话,选 1.2B。如果每次请求彼此独立,选 350M 或 230M。它们之间的分界线是对话连贯性,而这条线比基准分数所暗示的要清晰得多。

    如果你的模型需要选择Q4_K_M 下载体积
    维持多轮对话、运行智能体循环LFM2.5 1.2B731 MB
    调用工具、抽取字段、输出 JSON,每次一个请求LFM2.5 350M229 MB
    在浏览器标签页或树莓派里完成上述这些LFM2.5 230M153 MB
    知道很多世界知识更大的模型不适用
    Ertas Studio 的 Add Model 对话框,LFM 分组下有三个条目:LFM2.5 1.2B、LFM2.5 230M 和 LFM2.5 350M,均标注为 Liquid AI,下方是 Llama 分组
    Ertas Studio 模型选择器中的三种规模。三者都可在 T4 上训练,也都在免费套餐的 5B 参数上限之内。

    这个架构只有一部分是 Transformer

    LFM2.5 将双门控短程卷积块与分组查询注意力块交错排列。1.2B 与 350M 均为 16 层,按 10 个卷积块比 6 个注意力块划分。230M 为 14 层,按 8 比 6 划分。

    这种划分就是整个设计的核心。注意力相对序列长度是平方开销,卷积是线性开销。把两者混合,就能让长提示词在小参数量下依然划算,而同等规模的纯 Transformer 此时已经开始为自身的注意力矩阵付出代价。这也是为什么一个 230M 的模型能承载 32,768 token 的上下文,以及为什么这些模型在 CPU 上仍能保持吞吐,而同等规模的 Transformer 会明显吃力。

    整个家族的词表为 65,536 token,仅为 Gemma 3 的 256K 词表的四分之一。在这个参数量级上,嵌入表在文件体积中占比很大,因此紧凑的词表几乎完全解释了为什么一个 1.17B 的模型导出后比 Gemma 3 1B 还小。

    三种规模并排对比

    LFM2.5 230MLFM2.5 350MLFM2.5 1.2B
    参数量230M350M1.17B
    层数14(8 卷积 + 6 GQA)16(10 卷积 + 6 GQA)16(10 卷积 + 6 GQA)
    预训练预算19T token28T token28T token
    上下文长度32,76832,76832,768
    语言数1098
    发布日期2026 年 6 月 25 日2026 年 3 月 31 日2026 年 1 月 5 日
    Ertas GPU 层级T4T4T4
    免费套餐

    这张表里有两件事值得停下来看看。

    350M 拿到了与 1.2B 相同的 28 万亿 token 训练预算。小模型通常相对其容量而言训练不足,因为算力预算往往跟着参数量走。把一次完整规模的训练投在 350M 参数上是一个刻意的选择,而这在分数上体现了出来。

    230M 是从 350M 蒸馏而来的,而不是在那个规模上从零训练,随后又经过直接偏好优化和多领域强化学习精调。它覆盖的语言也是三者中最多的,多出了意大利语。

    基准数据

    以下所有数字均为 Liquid AI 公布的结果,来自 LFM2.5 发布文章350M 文章230M 文章。1.2B 的对比对象与两个更小的型号不同,因此两张表分开呈现。

    LFM2.5-1.2B-Instruct 对比 1B 至 1.7B 区间:

    基准LFM2.5 1.2BQwen3-1.7BGranite-4.0-h-1bGemma 3 1BLlama 3.2 1B
    IFEval86.2373.6880.0863.2552.37
    IFBench47.3321.3324.9320.4715.93
    MMLU-Pro44.3542.9127.6414.0420.80
    GPQA38.8934.8524.3424.2416.57
    AIME2514.009.33110.33

    LFM2.5-230M 与 350M 对比 1B 以下区间:

    基准LFM2.5 230MLFM2.5 350MLFM2-350MGranite 4.0-H-350MQwen3.5-0.8BGemma 3 1B IT
    IFEval71.7176.9664.9661.2759.9463.49
    IFBench38.4040.6918.2017.2222.8720.33
    Multi-IF37.7044.9232.9228.7041.6844.25
    BFCLv343.2644.1122.9543.0735.0816.61
    BFCLv421.0321.8612.2913.2818.707.17
    CaseReportBench22.5132.4511.6712.4413.832.28
    MMLU-Pro20.2520.0119.2913.1437.4214.04
    GPQA Diamond25.4130.6427.5822.3227.4123.89

    两张表的形态是一样的。指令遵循和函数调用的分数对这个参数量而言异常之高,世界知识的分数则平平甚至更差。Qwen3.5-0.8B 以明显优势拿下 MMLU-Pro,却在所有指令遵循的列上落后。

    这就是整个家族做出的取舍,而对设备端场景来说这个取舍是对的。一个能可靠照你说的做、事实由提示词提供的模型,胜过一个知道更多但更不听话的模型。给它们配上检索,让索引去承担知识。

    柱状图:LFM2.5 230M 在三个基准上相对于 LFM2.5 1.2B 的性能百分比。IFEval(指令遵循)为 83%,IFBench(更难的约束)为 81%,MMLU-Pro(世界知识)为 46%。
    350M 与 230M 在 MMLU-Pro 上相差不到四分之一分,因此几乎全部的知识下滑都发生在从 1.2B 往下的第一级台阶上。

    另一个值得细看的数字:230M 在 BFCLv3 上取得 43.26,而它 350M 的教师模型为 44.11。蒸馏几乎原封不动地把函数调用能力带下了整整一个规模档位。参数量约为其四倍的 Gemma 3 1B IT,在同一基准上只有 16.61。

    我们真正做过的那场对比

    基准把我们缩小到了一个候选名单,但在 350M 和 1.2B 之间做决定,需要真的做一个东西出来。

    Chatty Valley 是一个《星露谷物语》模组,用一个运行在玩家自己 CPU 上的微调模型替换了某位村民固定的台词。我们用同一份角色数据集分别训练了 350M 和 1.2B,并对两者跑了同一套评测。

    我本来希望 350M 能赢。让一个陌生人下载 229MB 远比 731MB 来得容易开口,而且微调后的 350M 把角色的语气和格式保持得非常好,产出的单句读起来完全就是那个角色。

    然后它就跟丢了。问它一句随意又略带混乱的话,你会得到流畅、完全符合人设的胡言乱语:一个针对你没问过的问题的回答,紧接着同一个想法再重复一遍,生怕你没看见。1.2B 能跟住对话,所以最终发布的是它,量化后 697MB。

    下面这一点值得带进你自己的项目。所有自动化指标都说 350M 没问题。 无破折号率、越狱泄漏率、句长分布、退化度、数字年龄泄漏,在两种规模上全部干净。这个失败只有靠真正对话才看得见。

    所以,如果你要在这个量级上微调任何对话类应用,请写一套脚本化的多轮探针,复现你真正在意的那种对话形态,并在相信指标面板之前先跑一遍。自动化维度能抓住回归,却看不见连贯性。

    对于单轮任务,也就是 350M 和 230M 真正的定位,上面这些都不适用。抽取、分类、结构化输出和工具调用都是彼此独立的请求,两个较小的规模都处理得很好。

    一个能在浏览器标签页里运行的 230M 模型

    230M 靠下载体积赢得自己的位置。量化后 153MB,小到可以在一个网页里下载完成。

    Corporate Goblin 就是我们的演示:LFM2.5-230M 的 LoRA 微调版本,合并后导出为 q4 ONNX,通过 transformers.js 在 WebGPU 上完全跑在客户端,并以 WASM 兜底。没有服务器,没有 API 密钥,没有按次调用成本,你输入的任何内容都不会离开访问者的机器。它把每个提示词都当作一位过分自信的增长大师来回答,并拒绝提供任何有用信息,而这正是它的用意。

    它认真证明的一点是:只要任务足够窄、数据集在这一点上足够一致,一个 230M 的模型守住一个明确人设的能力远超参数量给人的印象。当任务足够具体时,小模型是真的能打的。

    每种规模的发布成本

    下载体积是决定大多数设备端项目的约束条件,所以这里给出真实数字,读取自 Liquid AI 公布的 GGUF 构建,而不是估算。

    量化230M350M1.2B
    Q4_0149 MB219 MB696 MB
    Q4_K_M153 MB229 MB731 MB
    Q5_K_M172 MB260 MB843 MB
    Q6_K191 MB293 MB963 MB
    Q8_0247 MB379 MB1.25 GB
    BF16462 MB712 MB2.34 GB

    在两个较小的规模上,从 Q4_K_M 提到 Q6_K 分别只多 38MB 和 64MB。这个代价低到值得先测一测额外的质量对你的任务是不是几乎免费,再决定要不要默认用 Q4。

    柱状图:LFM2.5 家族各版本的 Q4_K_M 下载体积按比例绘制,并标注各自的 IFEval 得分。LFM2.5 1.2B 为 731 MB,IFEval 86.2;LFM2.5 350M 为 229 MB,IFEval 77.0;LFM2.5 230M 为 153 MB,IFEval 71.7。
    在这个区间内质量的变化远小于体积的变化,因此在它们之间做选择,通常取决于对话测试而不是基准数字。

    运行占用,均为 Liquid AI 在具名硬件上的实测:

    设备模型内存解码
    iPhone 13 Mini(Cactus)350M56 MB88 token/秒
    Snapdragon 8 Elite NPU350M169 MB15 token/秒
    树莓派 5230M293 MB42 token/秒
    Galaxy S25 Ultra230M375 MB213 token/秒
    AMD Ryzen AI Max 395+350M434 MB313 token/秒
    Galaxy S25 Ultra1.2B719 MB70 token/秒
    AMD Ryzen AI 9 HX 3701.2B856 MB116 token/秒

    作为参照,在 1.2B 占用 719MB 的同一台 Galaxy S25 Ultra 上,Qwen3-1.7B 需要 1,306MB。

    在 Ertas 上微调 LFM2.5

    三种规模都在 T4 层级上训练,这是我们的入门层级,也是免费套餐使用的层级。三者都在免费套餐的 5B 参数上限之内,因此即便是其中最大的那个,完整训练也可以零成本开始。权重原生支持 bf16,训练直接以 bf16 进行,没有回退 fp32 的性能损失。

    适用于 2B 以下基础模型的配方:

    设置取值
    学习率3e-4 到 5e-4
    批大小4
    梯度累积2
    训练轮次8 到 16

    相比 7B 模型,小模型需要在小数据集上多走几遍行为才会稳定下来,并且能承受更高的学习率而不崩溃。

    导出结果可以是供 llama.cpp、Ollama 和 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 适配器(如果你希望把适配器单独保留、自行合并)。若用于浏览器部署,请把适配器合并后转换为 q4 ONNX,这正是 Corporate Goblin 走的路径。

    有一件事需要提前规划:这个家族的工具调用默认使用包裹在专用 <|tool_call_start|><|tool_call_end|> token 之间的 Python 式函数调用。如果你的运行时期望 JSON,可以在系统提示词里要求。请让训练数据与你打算发布的形式保持一致。

    发布前关于许可的一个提醒

    LFM2.5 依据 LFM Open License v1.0 发布,这是 Liquid AI 自有的协议文本。商用被允许但附带条件,其条款与 Apache 2.0 或 MIT 不同。该协议会随你的微调模型一起传递,因此在基于这一基础模型发布商业产品前请先阅读。Ertas 目录中的其余模型大多是 Apache 2.0,很容易让人以为这个也一样。

    常见问题

    LFM2.5 230M、350M 和 1.2B 有什么区别?

    它们共享同一架构和 32,768 token 的上下文窗口,差别在容量。1.2B 能维持多轮对话和智能体循环。350M 在函数调用和结构化抽取上紧追 1.2B,而下载体积只有三分之一。230M 由 350M 蒸馏而来,在工具调用上让出的很少,同时能塞进 153MB,小到足以放进浏览器。

    微调聊天机器人应该选哪种 LFM2.5 规模?

    1.2B。在我们自己的测试中,微调后的 350M 完美保持了角色的语气,随后却在多轮随意对话中跟丢了线索,而 1.2B 跟住了。所有自动化指标在两种规模上都通过了,因此这个差别只有通过脚本化的对话探针才浮现出来。

    LFM2.5 能在网页浏览器里运行吗?

    可以。导出为 ONNX、量化到 q4,然后通过 transformers.js 在 WebGPU 上运行,并以 WASM 兜底。153MB 的 230M 是首次加载的实用选择。playground.ertas.ai 上的 Corporate Goblin 就是一个可用的例子。

    在这个规模上 LFM2.5 比 Qwen 或 Gemma 更好吗?

    在指令遵循和函数调用上,明显更好。LFM2.5-1.2B 的 IFEval 为 86.23,Qwen3-1.7B 为 73.68,Gemma 3 1B 为 63.25;LFM2.5-350M 的 BFCLv3 为 44.11,Gemma 3 1B IT 为 16.61。在世界知识上它会输:Qwen3.5-0.8B 的 MMLU-Pro 为 37.42,而 230M 为 20.25。按你的任务真正需要哪一项来选。

    微调 LFM2.5 要花多少钱?

    起步不花钱。三种规模都在 Ertas 免费套餐的 5B 参数上限之内,并在 T4 层级上训练。付费层级增加了什么,请参见价格页面

    LFM2.5 不擅长什么?

    Liquid AI 不推荐这个家族用于知识密集型任务和编程,并针对 230M 额外列出了高级数学和创意写作。多轮对话是两个较小规模的另一个边界。请把事实放进提示词里,并给这些模型一个具体的任务。


    包含完整规格、基准与硬件需求的模型页面:LFM2.5 家族LFM2.5 230MLFM2.5 350MLFM2.5 1.2B

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading