LFM2.5 1.2B vs Llama 3.2 1B
两款都能在免费 T4 上微调的 1B 级模型。指令遵循、真实手机上的内存占用、上下文长度、许可证,以及设备端场景该选哪一个。
Overview
截至 2026 年 8 月,LFM2.5 1.2B 与 Llama 3.2 1B 是 Ertas 目录中仅有的两款 1B 级基座模型。两者都在入门级 T4 上训练,都包含在免费套餐内,导出的 GGUF 也都不到 1 GB。纸面上它们几乎可以互换,实际上却是为不同任务打造的,而区分二者的那项基准,恰好是设备端项目最关心的。
Llama 3.2 1B 是稠密 Transformer,上下文窗口 128,000 个词元,生态是所有小型开放权重模型中最深厚的。只要某个 1B 模型存在微调配方、量化预设或移动端集成指南,那几乎一定是为它准备的。
LFM2.5 1.2B 则是混合架构。它把双门控短程卷积模块与分组查询注意力模块交替排列,共 16 层,其中 10 层卷积、6 层注意力。卷积的计算量随序列长度线性增长,注意力则是平方增长,正是这一点让这样小的模型在长提示下依然便宜。它的上下文窗口是 32,768 个词元,只有 Llama 的四分之一;词表为 65,536,这也是它导出文件如此紧凑的主要原因。
Feature Comparison
| Feature | LFM2.5 1.2B | Llama 3.2 1B |
|---|---|---|
| 参数量 | 11.7 亿 | 10 亿 |
| 架构 | 混合:卷积 + 分组查询注意力 | 稠密 Transformer |
| 上下文窗口 | 32,768 个词元 | 128,000 个词元 |
| 词表大小 | 65,536 | 128,256 |
| IFEval(指令遵循) | 86.23 | 52.37 |
| Q4_K_M 导出体积 | 731 MB | 810 MB |
| 手机实测占用 | 719 MB(Galaxy S25 Ultra) | Meta 未公布 |
| 许可证 | LFM Open License v1.0 | Llama Community License |
| 在 Ertas 微调所需 GPU 层级 | T4 | T4 |
| 可用 Ertas 免费套餐训练 | ||
| 原生工具调用词元 | 支持,默认输出 Python 风格调用 | 依靠提示词格式 |
| 知识截止时间 | 2024 年中 | 2023 年 12 月 |
| 生态成熟度 | 较新,2026 年发布 | 1B 级中最深厚 |
Strengths
LFM2.5 1.2B
- 指令遵循是最主要的差距。截至 2026 年 8 月,据 Liquid AI 实测,LFM2.5 1.2B 的 IFEval 得分为 86.23,Llama 3.2 1B 为 52.37。如果模型的职责是每次都输出可解析的 JSON 对象或格式正确的工具调用,这一项比常识记忆重要得多。
- 工具调用是原生能力,而不是提示词技巧。LFM2.5 会在专用词元之间输出 Python 风格的函数调用,只需一句系统提示即可切换为 JSON 输出。
- 参数更多,导出反而更小:Q4_K_M 下 731 MB,Llama 为 810 MB,尽管参数量多出 17%。原因是 65,536 的词表让嵌入表保持紧凑,而在这个量级上,嵌入表主导着文件体积。
- 在具名硬件上公布了实测占用。Liquid 在 Galaxy S25 Ultra 上测得 719 MB。Meta 没有为 Llama 3.2 1B 公布对应数字,因此要评估部署规模只能自己实测。
- 权重原生为 bf16,因此在 Ertas 上训练可以保持 bf16,无需在 Turing 硬件上回退到 fp32。
Llama 3.2 1B
- 128,000 对 32,768 的上下文窗口,空间是四倍。只要任务是把长文档直接放进提示词而不是分块检索,这一项就是决定性的。
- 1B 级中最深厚的生态。现成的微调版本、量化预设、移动端集成指南和社区验证过的配方,绝大多数都优先支持 Llama。
- 多数法务团队已经审阅过的许可证。Llama Community License 设有 7 亿月活用户上限并要求署名,但足够熟悉;而 LFM Open License v1.0 是 Liquid 自己的文本,需要重新审阅。
- 通用知识更广。Llama 3.2 1B 面向通用能力训练,而 LFM2.5 明确用世界知识换取了指令遵循的可靠性。
- 在编程和数学上更强,而这两类任务正是 Liquid 明确不推荐 LFM2.5 去做的。
Which Should You Choose?
这正是 LFM2.5 的设计目标。IFEval 86.23 对 52.37,意味着一个能可靠产出你所要求格式的模型,和一个必须外包一层重试逻辑的模型之间的区别。事实本身来自文档,所以世界知识偏弱在这里没有代价。
128,000 对 32,768 个词元就足以决定。LFM2.5 的混合架构确实让长提示的处理更便宜,但它无法处理超出自身窗口的提示;而为了塞进去而分块,等于又把你本想避开的检索问题请了回来。
731 MB 对 810 MB 本身差距不大,真正的优势是公开的设备端实测数据:写代码之前就能把部署规模算清楚。Chatty Valley 就在 Stardew Valley 模组里装了一个 697 MB 的 LFM2.5 1.2B 微调模型,完全跑在玩家自己的 CPU 上。
Liquid 明确不建议把 LFM2.5 用于知识密集型任务或编程。如果模型需要的是知道事情而不是做成事情,在这个尺寸上 Llama 3.2 1B 是更好的基座,而更大的基座还要更好。
生态成熟度和已审阅的许可证都是要重新付出的真实成本。除非指令遵循的差距对你的任务是关键,否则迁移通常并不划算。
Verdict
如 果模型的职责是在固定且不算大的上下文里精确遵循指令,就选 LFM2.5 1.2B:结构化抽取、工具调用、设备端智能体、角色与游戏 AI 都属于这一类。IFEval 的差距大到足以改变你能否在不加重试层的情况下直接上线,而公开的硬件实测数据也把部署评估从一场实验变成了一次查表。
如果上下文长度决定成败,或者你需要通用知识与代码能力,又或者成熟生态与已审阅的许可证比指令遵循的差距更有价值,就选 Llama 3.2 1B。对很多团队来说,坦率的答案是:Llama 是更稳妥的默认选项,LFM2.5 是更好的专才。
两者都能在 Ertas Studio 的免费 T4 上微调,所以解决分歧最省钱的办法,就是用你自己的数据各训一个再比较。在这个尺寸上,那是一个下午的事,不是一个项目。
How Ertas Fits In
两款模型都在 Ertas Studio 的 T4 层级微调,也都在免费套餐的参数上限之内,因此任选其一都可以零成本训练。对 20 亿参数以下的基座,行之有效的配方是比 7B 模型更高的学习率和更多的轮次:学习率 3e-4 到 5e-4,批大小 4,梯度累积 2,训练 8 到 16 轮。小模型需要更多遍数据,行为才会固定下来。
导出格式为 GGUF,可直接用于 llama.cpp、Ollama 和 LM Studio;也可以导出 safetensors 格式的 LoRA 适配器,把适配器单独保留、由你自己合并。有两个 Ertas 项目在生产环境中使用这个系列,选型之前值得一读:Chatty Valley 是量化到 697 MB 的 1.2B 微调模型,运行在 Stardew Valley 模组里;Corporate Goblin 则是 230M 的 LoRA,导出为 q4 ONNX 后完全在浏览器 中运行。
还有一点关于许可证的提醒,它会随你的微调结果一起传递:LFM Open License v1.0 是 Liquid AI 自己的文本,并非 Apache 2.0;Llama Community License 也有自己的条件。基于其中任何一个基座构建商业产品,都需要真正把许可证读一遍,而不是想当然。
Related Resources
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.