Fine-Tune LFM2.5 1.2B with Ertas

    LFM2.5-1.2B-Instruct 是 Liquid AI 的旗艦裝置端模型,參數量 1.17B,在 IFEval 上取得 86.23、MMLU-Pro 上取得 44.35,執行記憶體不到 1GB。它是 LFM2.5 中最大的規模,也是當模型需要維持多輪對話或驅動代理迴圈時應當選擇的版本。

    1.2B實際 1.17BLiquid AI

    LFM2.5 1.2B at a Glance

    完整名稱LFM2.5-1.2B-Instruct
    開發方Liquid AI
    參數量1.17B
    層數16 層(10 個雙閘控卷積區塊 + 6 個 GQA 區塊)
    訓練預算28 兆 token
    上下文長度32,768 token
    詞表大小65,536
    知識截止2024 年年中
    支援語言英語、阿拉伯語、中文、法語、德語、日語、韓語、西班牙語
    發布日期2026 年 1 月 5 日
    授權條款LFM Open License v1.0(lfm1.0)
    在 Ertas 上微調所需 GPU 層級T4
    可在 Ertas 免費方案上訓練
    Q4_K_M 匯出體積731 MB
    Ertas 鏡像ErtasAI/LFM2.5-1.2B-Instruct

    Overview

    LFM2.5-1.2B-Instruct 是 Liquid AI LFM2.5 家族中最大的文字模型,也是 2026 年 1 月 5 日那次發布的旗艦。它擁有 1.17B 參數、16 層結構,按 10 個雙閘控短程卷積區塊與 6 個分組查詢注意力區塊劃分,預訓練量為 28 兆 token,並在其上疊加了大規模多階段強化學習流程。

    上下文視窗為 32,768 token,詞表為 65,536,這個規模是刻意精簡的。在這個參數量級上,嵌入與反嵌入表在檔案體積中占比很大,因此更小的詞表會直接換來更小的下載體積。這也是為什麼它的 Q4_K_M 匯出為 731MB,而紙面上更小的 Gemma 3 1B 匯出卻是 810MB。

    這個模型真正擅長什麼,從基準的形態就看得出來。它在 IFEval 上取得 86.23、IFBench 上取得 47.33(兩者都是指令遵循類指標),而 Qwen3-1.7B 分別為 73.68 與 21.33。GPQA 上為 38.89 對 34.85,MMLU-Pro 上為 44.35 對 42.91。與規模最接近的 Llama 3.2 1B 相比差距更大:IFEval 86.23 對 52.37,MMLU-Pro 44.35 對 20.80。

    Liquid 推薦將其用於代理任務、資料擷取與 RAG,並建議避開知識密集型工作與程式設計。這是對其能力樣貌的準確描述:它以超出規模的可靠度遵循指令,同時對世界的了解不如雲端模型,因此它是好的執行者,而不是好的百科全書。

    除 instruct 版本外還有三個同源檢查點:用於重度微調的 LFM2.5-1.2B-Base、建議溫度更低(0.05)的推理版 LFM2.5-1.2B-Thinking,以及針對日語最佳化的 LFM2.5-1.2B-JP。Ertas 目錄收錄的是 instruct 檢查點,鏡像位址為 `ErtasAI/LFM2.5-1.2B-Instruct`。

    Key Features

    IFEval 86.23 的指令遵循能力是它最突出的特性。作為對照,Granite-4.0-h-1b 為 80.08,Qwen3-1.7B 為 73.68,Gemma 3 1B 為 63.25,Llama 3.2 1B 為 52.37。使用更難、更少見約束的 IFBench 把差距拉得更開:LFM2.5 為 47.33,次佳者為 24.93。如果你的微調模型必須在每次請求中都輸出特定格式,這個面向決定了它在正式環境中是否可用。

    工具呼叫是原生能力。模型預設在 `<|tool_call_start|>` 與 `<|tool_call_end|>` token 之間寫出 Python 式函式呼叫,解讀工具回傳結果,然後以純文字作答。若你的執行環境期望 JSON 形式,也可以透過系統提示詞切換。對話範本為類 ChatML 格式,因此大多數現有工具鏈無需特殊處理即可解析。

    在 Liquid 實測的每個目標上,記憶體占用都維持在 1GB 以內。在 Galaxy S25 Ultra 上占用 719MB,而同一裝置上的 Qwen3-1.7B 需要 1,306MB,預填充 335 token/秒,解碼 70 token/秒。在 AMD Ryzen AI 9 HX 370 上占用 856MB,預填充 2,975,解碼 116。在 Qualcomm Dragonwing IQ9 IoT NPU 上占用 0.9GB,預填充 2,143,解碼 53。

    AIME25 的 14.00 值得如實看待。它高於 Qwen3-1.7B 的 9.33,也遠超 Llama 3.2 1B 的 0.33,但絕對分數依然偏低。競賽數學並不是一個 1.2B 裝置端模型該做的事。若你需要這個規模下的推理深度,Liquid 專門為此打造了 LFM2.5-1.2B-Thinking 檢查點。

    Fine-Tuning with Ertas

    LFM2.5 1.2B 在 Ertas Studio 的 T4 層級上微調,並且在免費方案的 5B 參數上限之內,因此一次完整訓練可以零成本開始。權重原生支援 bf16,在 Turing 硬體上不會有退回 fp32 的效能損失。

    適用於這個規模的配方是:學習率 3e-4 到 5e-4,批次大小 4,梯度累積 2,訓練 8 到 16 個輪次。相較 7B 模型,1.2B 需要在小資料集上多走幾遍,行為才會穩定,而且能承受更高的學習率而不崩潰。

    匯出結果可以是供 llama.cpp、Ollama 與 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 轉接器。Liquid 自己的 Q4_K_M 建置為 731MB;Ertas 將微調轉接器合併進這個基礎模型後匯出的 [Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 為 697MB,這是一個《星露谷物語》模組,用生成式的角色對白取代了村民原本固定的台詞,並完全在玩家自己的 CPU 上執行。

    那個專案是我們目前關於微調這個模型最詳細的公開紀錄,其中兩個發現值得帶進你自己的訓練。第一,1.2B 能維持多輪對話,而同家族的 350M 會開始回答沒人問過的問題,而且這個差別只有靠真正對話才能發現。無破折號率、越獄外洩率、句長分布與退化度在兩種規模上都是乾淨的。

    第二個發現關於附和傾向。讓模型在取樣式對抗壓力下拒絕一個虛假前提,比讓它維持某種語氣難得多。監督式微調塑造了這個行為卻沒有消除它,40 組偏好對的 LoRA DPO 只是把同一個天花板往外推了一點,並沒有突破它。貪婪解碼完全看不到這個問題。如果你的微調需要模型對使用者的斷言提出反駁,請為此單獨預留預算,並用取樣方式去測試它。

    Use Cases

    裝置端助理是首要情境。在旗艦手機上占用 719MB、解碼 70 token/秒,一個微調後的 1.2B 能以接近對話的節奏作答,不需要網路往返,也沒有按次呼叫成本。Liquid 將代理任務、資料擷取與 RAG 列為推薦三件組,而指令遵循分數支撐了這三者。

    在本機執行的工具呼叫代理是最契合的用法。原生 Python 式函式呼叫、可容納工具定義與回傳結果的 32,768 token 上下文,加上 86.23 的 IFEval,意味著模型能穩定產出你的執行環境可以解析的呼叫。再搭配檢索,讓事實來自你的索引,模型負責編排。

    遊戲與角色 AI 是 Chatty Valley 展示的模式:一個明確的人設、幾百行訓練資料,以及一個玩家真的會接受的 697MB 下載體積。規模在這裡之所以重要有一個具體原因:角色類工作需要在十幾輪對話中保持連貫,而這正是 350M 最先失去的能力。

    當原文就在提示詞裡時,文件處理與結構化擷取表現良好。高指令遵循加上中等世界知識,正是把合約、表單或郵件轉成結構化欄位所需要的樣貌。

    應當另尋他路的情境:知識密集型問答、程式碼產生與競賽數學。Liquid 直接這麼說,MMLU-Pro 44.35 與 AIME25 14.00 就是證據。對於這些任務,目錄中 7B 或 8B 的基礎模型是更好的起點。

    Hardware Requirements

    推論,依據 Liquid AI 的實測資料。搭載 Snapdragon Gen4 的 Samsung Galaxy S25 Ultra:預填充 335 token/秒,解碼 70 token/秒,記憶體 719MB。AMD Ryzen AI 9 HX 370 CPU:預填充 2,975,解碼 116,占用 856MB。Qualcomm Dragonwing IQ9 IoT NPU:預填充 2,143,解碼 53,占用 0.9GB。以上每個目標都維持在 1GB 以內。

    匯出體積,讀取自 Liquid 公布的 GGUF 建置:Q4_0 為 696MB,Q4_K_M 為 731MB,Q5_K_M 為 843MB,Q6_K 為 963MB,Q8_0 為 1.25GB,BF16 為 2.34GB。除非你已經實測出提高精度的品質效益,否則 Q4_K_M 是值得直接發布的預設選擇。

    在 Ertas 上微調時,T4 層級即可勝任,這是入門層級,也是免費方案使用的層級,不需要 A10G。

    若在 Ertas 之外於本機微調,1.2B 的 QLoRA 需要 8GB 以上顯示記憶體,RTX 3060 12GB 及更好的顯示卡都在範圍之內。在這個規模下單步訓練速度足夠快,真正耗掉一週時間的會是資料集迭代,而不是 GPU 時間。

    Frequently Asked Questions

    LFM2.5 1.2B 是什麼?
    LFM2.5-1.2B-Instruct 是 Liquid AI 於 2026 年 1 月 5 日發布的旗艦裝置端語言模型。它擁有 1.17B 參數、16 層結構,混合了 10 個雙閘控卷積區塊與 6 個分組查詢注意力區塊,上下文視窗為 32,768 token,預訓練量為 28 兆 token。它可在手機、CPU 與 NPU 上以不到 1GB 的記憶體執行。
    LFM2.5 1.2B 與 Qwen3-1.7B、Llama 3.2 1B 相比如何?
    在 Liquid AI 公布的基準結果中,LFM2.5-1.2B-Instruct 的 IFEval 為 86.23,Qwen3-1.7B 為 73.68,Llama 3.2 1B 為 52.37。IFBench 上為 47.33 對 21.33 與 15.93。MMLU-Pro 上為 44.35 對 42.91 與 20.80。GPQA 上為 38.89 對 34.85 與 16.57。此外它在 Galaxy S25 Ultra 上僅占用 719MB,而 Qwen3-1.7B 需要 1,306MB。
    微調後的 LFM2.5 1.2B 匯出檔案有多大?
    依據 Liquid AI 公布的 GGUF 建置,Q4_K_M 下約為 731MB。Ertas 為《星露谷物語》模組 Chatty Valley 匯出的微調版 1.2B 發布體積為 697MB。Q8_0 下約 1.25GB,BF16 下為 2.34GB。
    我該用 LFM2.5 1.2B 還是 LFM2.5 350M?
    當模型需要跨多輪維持對話或執行代理迴圈時,選 1.2B。當每次請求彼此獨立時(例如擷取、分類或單次工具呼叫),並且 229MB 的更小下載體積很重要時,選 350M。
    我們在打造 Chatty Valley 時直接做過這場對照。微調後的 350M 完美維持了角色的語氣與格式,隨後卻在多輪隨性對話中跟丟了線索,對沒有被問到的問題給出流暢且完全符合人設的回答。所有自動化指標都顯示 350M 沒問題,只有一套腳本化的對話探針發現了它。
    可以在 Ertas 上免費微調 LFM2.5 1.2B 嗎?
    可以。1.17B 參數遠低於免費方案的 5B 上限,並且在 T4 GPU 層級上訓練。對 2B 以下的基礎模型,建議配方為學習率 3e-4 到 5e-4,批次大小 4,梯度累積 2,訓練 8 到 16 個輪次。
    LFM2.5 1.2B 支援工具呼叫嗎?
    原生支援。它在專用的 `<|tool_call_start|>` 與 `<|tool_call_end|>` token 之間寫出 Python 式函式呼叫,依據回傳的工具結果繼續執行,並以純文字作答。你也可以透過系統提示詞切換為 JSON 格式的呼叫。對話範本為類 ChatML 格式。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.