Fine-Tune LFM2.5 with Ertas

    Liquid AI 的 LFM2.5 是一組面向裝置端部署的混合架構語言模型,提供 230M、350M 與 1.2B 三種參數規模。它以雙閘控卷積區塊搭配分組查詢注意力為骨幹,而非純 Transformer 堆疊。三者皆支援 32,768 token 上下文視窗,執行記憶體低於 1GB,是 Ertas 目錄中最小的基礎模型。

    230M350M1.2BLiquid AI
    Ertas Studio 的 Add Model 對話框,LFM 分組下有三個項目:LFM2.5 1.2B、LFM2.5 230M 與 LFM2.5 350M,皆標註為 Liquid AI,下方是 Llama 分組
    Ertas Studio 模型選擇器中的三種 LFM2.5 規模。三者都可在 T4 上訓練,也都在免費方案的 5B 參數上限之內。

    LFM2.5 at a Glance

    開發方Liquid AI
    Ertas 目錄中的規模230M、350M、1.2B(實際 1.17B)
    架構混合架構:雙閘控短程卷積區塊 + 分組查詢注意力(GQA)區塊
    上下文長度32,768 token(三種規模一致)
    詞表大小65,536
    知識截止2024 年年中
    授權條款LFM Open License v1.0(lfm1.0)
    在 Ertas 上微調所需 GPU 層級三種規模皆為 T4
    可在 Ertas 免費方案上訓練是,三種皆可
    匯出格式GGUF 與 safetensors LoRA 轉接器
    Q4_K_M 匯出體積153 MB(230M)、229 MB(350M)、731 MB(1.2B)
    對話範本類 ChatML,預設輸出 Python 式工具呼叫

    Overview

    LFM2.5 是 Liquid AI 為裝置端部署打造的混合架構語言模型家族。Ertas 目錄中收錄了三種文字規模:LFM2.5-230M、LFM2.5-350M 與 LFM2.5-1.2B-Instruct。三者皆為開放權重,皆支援 32,768 token 的上下文視窗,並且都能在手機、筆電或樹莓派上以不到 1GB 的記憶體執行。

    真正把這個家族與目錄中其他小模型區隔開的是架構。LFM2.5 並未由上而下堆疊 Transformer 區塊,而是將雙閘控短程卷積區塊與分組查詢注意力區塊交錯排列。1.2B 與 350M 皆為 16 層,按 10 個卷積區塊比 6 個注意力區塊劃分;230M 為 14 層,按 8 比 6 劃分。卷積區塊相對序列長度是線性成本,而注意力是平方成本,因此這種混合結構讓長提示詞在小參數量下依然划算,而同等規模的純 Transformer 此時已開始為自身的注意力矩陣付出代價。

    這個家族在 2026 年分三次發布。LFM2.5-1.2B-Instruct 於 1 月 5 日與視覺、音訊版本一同推出,預訓練量相較上一代 LFM2 從 10T 擴展到 28T token。LFM2.5-350M 於 3 月 31 日跟進,沿用同樣的 28T 預算。LFM2.5-230M 於 6 月 25 日發布,以 19T token 訓練並自 350M 蒸餾而來,隨後經過直接偏好最佳化與多領域強化學習精修。

    Liquid 為每種規模提供原生 safetensors、GGUF、ONNX 與 MLX 版本,並為 Intel 硬體提供 OpenVINO 建置。授權條款為 LFM Open License v1.0,這是 Liquid 自有的條款文本,而非 Apache 2.0 或 MIT。商業使用被允許但附帶條件,因此在大規模發布前請先閱讀。

    在 Ertas 上,三種規模都在 T4 上微調,也都在免費方案的 5B 參數上限之內。它們是我們收錄的最小基礎模型。如果你的目標是瀏覽器、手機或任何記憶體受限的裝置,從這裡起步會比把更大的模型壓縮下來再期待品質還在更合理。

    Key Features

    指令遵循是這個家族最明顯超出自身規模的地方。LFM2.5-1.2B-Instruct 在 IFEval 上取得 86.23,而參數量大 45% 的 Qwen3-1.7B 為 73.68,Llama 3.2 1B 為 52.37。在衡量更難約束遵循能力的 IFBench 上,差距進一步拉大到 47.33 對 21.33。對於一個每次請求都必須輸出格式正確的工具呼叫或可解析 JSON 的模型而言,這個面向比記住多少知識更重要。

    工具呼叫是原生能力,而非提示詞工程的技巧。LFM2.5 預設在專用的 `<|tool_call_start|>` 與 `<|tool_call_end|>` token 之間寫出 Python 式函式呼叫,你也可以透過系統提示詞切換為 JSON 輸出。350M 在 BFCLv3 上取得 44.11,230M 取得 43.26,兩者相差不到一分,並明顯領先前代 LFM2-350M 的 22.95。一個 230M 的模型能在函式呼叫基準上站穩腳步,對這個參數量而言確實令人意外。

    記憶體占用是最具實務意義的亮點。Liquid 實測 350M 在 iPhone 13 Mini 上透過 Cactus 引擎占用 56MB,在 AMD Ryzen AI Max 395+ 上透過 llama.cpp 占用 434MB。230M 在 Galaxy S25 Ultra 上占用 375MB,解碼速度 213 token/秒;在樹莓派 5 上占用 293MB。1.2B 在 CPU、行動端與 NPU 目標上皆維持在 1GB 以內。

    多語言涵蓋範圍比規模所暗示的更廣,而且模型愈小涵蓋愈寬。1.2B 涵蓋八種語言,350M 九種,230M 十種(含義大利語)。三者共用 65,536 的詞表,僅為 Gemma 3 的 256K 詞表的四分之一,這也是匯出體積如此之小的重要原因。在這個參數量級上,嵌入表在檔案體積中占比很大,因此精簡的詞表會直接換來更小的下載體積。

    Fine-Tuning with Ertas

    三種 LFM2.5 規模都在 Ertas Studio 的 T4 層級上微調,這是入門 GPU 層級,並且三者都在免費方案的 5B 參數上限之內。你可以零成本訓練 1.2B。這些模型原生支援 bf16,因此直接以 bf16 訓練,無需像 Gemma 3 在 Turing 硬體上那樣退回 fp32。

    對這麼小的家族而言,行之有效的配方是比 7B 模型更高的學習率與更多的輪次。Ertas 針對 2B 以下基礎模型的訓練建議是:學習率 3e-4 到 5e-4,批次大小 4,梯度累積 2,訓練 8 到 16 個輪次。小模型需要在資料上多走幾遍,行為才會穩定下來,而且能承受這種較積極的學習率而不崩潰。

    匯出結果可以是供 llama.cpp、Ollama 與 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 轉接器(若你希望把轉接器單獨保留、自行合併)。微調後的 230M 在 Q4_K_M 下約 153MB,350M 約 229MB,1.2B 約 731MB。這些下載體積可以直接呈現給終端使用者,無需額外說明。

    Ertas 有兩個以這個家族為基礎的線上專案。[Chatty Valley](/blog/chatty-valley-on-device-ai-mod-stardew-valley) 是 LFM2.5-1.2B-Instruct 的微調版本,為《星露谷物語》中的一位村民產生對話,量化到 Q4_K_M 後為 697MB,完全在玩家自己的 CPU 上執行,不需要 API 金鑰。Corporate Goblin 是 LFM2.5-230M 的 LoRA 微調版本,合併後匯出為 q4 ONNX,透過 transformers.js 與 WebGPU 完全在瀏覽器中執行,網址是 [playground.ertas.ai](https://playground.ertas.ai)。兩者分別涵蓋了這個家族的兩端,也涵蓋了兩條匯出路徑。

    開始之前唯一需要知道的是:LFM Open License v1.0 會隨著你的微調模型一起傳遞。它是 Liquid AI 自有條款的授權文本,因此以 LFM2.5 為基礎的商業產品需要真正讀過這份條款,而不是想當然。

    Use Cases

    資料擷取與結構化輸出是 Liquid 為這個家族每種規模都優先推薦的情境,基準表現也支持這一點。高 IFEval 與 IFBench 搭配中等的 MMLU-Pro,描述的是一個能可靠遵循指令形態、但對世界了解較少的模型,而這正是把文件轉成 JSON 時你想要的取捨。事實來自文件本身。

    裝置端代理與工具呼叫是第二個情境。Liquid 推薦 1.2B 用於代理任務與 RAG,230M 則定位在輕量級裝置端代理流程。一個在手機上以 213 token/秒輸出正確函式呼叫、且資料完全不離開裝置的模型,打開了雲端往返在延遲或成本上不划算的助理形態。

    瀏覽器端 AI 是 230M 特別能立足的地方。量化後 153MB 是合理的首次載入體積,匯出為 ONNX 後可透過 transformers.js 在 WebGPU 上執行,並以 WASM 作為後備。Corporate Goblin 正是如此:一個下載到使用者機器上並在本機執行的角色模型,無伺服器,也沒有按次呼叫成本。

    遊戲與角色 AI 是 Chatty Valley 驗證過的模式:一個明確的人設、一份精煉的資料集,以及一個小到玩家願意下載的模型。1.2B 能在多輪對話中維持角色;350M 能守住語氣卻會跟丟話題,這個結論值得在選型之前讀一讀。

    應當避開的情境:Liquid 明確不推薦這個家族用於知識密集型任務與程式設計,230M 的模型說明還把高階數學與創意寫作也列入其中。230M 在 MMLU-Pro 上的 20.25 對比 Qwen3.5-0.8B 的 37.42,就是原因所在。如果你的任務需要模型知道很多事情而不是做很多事情,請看更大的基礎模型。

    Hardware Requirements

    推論占用,皆為 Liquid AI 在具名硬體上的實測資料。230M 在 Galaxy S25 Ultra 上占用 375MB,預填充 1,158 token/秒,解碼 213 token/秒;在樹莓派 5 上以 4-bit 量化、2K 上下文執行時占用 293MB,預填充 523,解碼 42。350M 在 iPhone 13 Mini 上透過 Cactus 引擎占用 56MB,預填充 496,解碼 88;在 Snapdragon 8 Elite NPU 上占用 169MB;在 AMD Ryzen AI Max 395+ 上占用 434MB,解碼 313 token/秒。1.2B 在 Galaxy S25 Ultra 上占用 719MB,而同一裝置上的 Qwen3-1.7B 需要 1,306MB;在 AMD Ryzen AI 9 HX 370 上占用 856MB。

    Q4_K_M 匯出體積,讀取自 Liquid 公布的 GGUF 建置:230M 為 153MB,350M 為 229MB,1.2B 為 731MB。Q8_0 下分別為 247MB、379MB 與 1.25GB。完整 BF16 權重分別為 462MB、712MB 與 2.34GB。

    在 Ertas 上微調時,三種規模都在 T4 層級訓練,這是入門層級,也是免費方案使用的層級。這個家族的任何規模都不需要動用 A10G,而原生 bf16 權重意味著在 Turing 硬體上不會有退回 fp32 的效能損失。

    若你在本機而非 Ertas 上訓練,230M 與 350M 的 QLoRA 可以輕鬆放進 6GB 的消費級 GPU,1.2B 則需要 8GB 以上。在這個規模下,單步訓練速度足夠快,真正的瓶頸會變成資料集的迭代,而不是等待訓練完成。

    Frequently Asked Questions

    LFM2.5 是什麼?
    LFM2.5 是 Liquid AI 推出的開放權重混合架構語言模型家族,面向裝置端部署,提供 230M、350M 與 1.2B 三種參數規模,皆支援 32,768 token 的上下文視窗。它並未採用純 Transformer 堆疊,而是將雙閘控短程卷積區塊與分組查詢注意力區塊交錯排列,因此在較小參數量下依然能以較低成本處理長序列推論。
    LFM2.5 支援多長的上下文?
    三種 LFM2.5 文字規模皆支援 32,768 token。230M 是在其 19T token 預訓練過程中,透過專門的 32K 上下文擴展階段達到這個長度的。
    我應該選擇哪一種 LFM2.5 規模?
    當模型需要維持多輪對話或執行代理迴圈時,選擇 1.2B。當每次請求彼此獨立時(例如工具呼叫、資料擷取與結構化輸出),選擇 350M。當下載體積是決定性限制時選擇 230M,例如瀏覽器內的模型,或整體下載預算只有兩三百 MB 的手機應用程式。
    我們自己的經驗是:微調後的 350M 能完美維持角色的語氣與格式,但在幾輪之後就會跟丟一段隨性對話的線索,而 1.2B 能跟住。我們跑過的所有自動化指標都顯示 350M 沒有問題,只有一套腳本化的對話探針才發現了它。
    LFM2.5 可以免費商業使用嗎?
    LFM2.5 依 LFM Open License v1.0 發布,這是 Liquid AI 自有的授權條款,而非 Apache 2.0 或 MIT。商業使用被允許但附帶條件。由於其條款與常見的寬鬆授權不同,在以 LFM2.5 為基礎發布商業產品前請先閱讀該條款。該授權會隨你的微調模型一起傳遞。
    可以在 Ertas 免費方案上微調 LFM2.5 嗎?
    可以。三種 LFM2.5 規模都在免費方案的 5B 參數上限之內,並且都在 T4 GPU 層級上訓練。1.2B 是這個家族中最大的,同樣可以免費訓練。
    微調後的 LFM2.5 匯出檔案有多大?
    在 Q4_K_M 下,230M 約 153MB,350M 約 229MB,1.2B 約 731MB。Ertas 支援匯出為供 llama.cpp、Ollama 與 LM Studio 使用的 GGUF,或匯出為 safetensors LoRA 轉接器。Chatty Valley 發布的 1.2B 匯出檔案為 697MB。
    LFM2.5 不擅長什麼?
    Liquid AI 不推薦這個家族用於知識密集型任務與程式設計,並針對 230M 額外列出高階數學與創意寫作。基準表現說明了原因:LFM2.5-230M 在 MMLU-Pro 上為 20.25,而 Qwen3.5-0.8B 為 37.42。這些模型擅長遵循指令與呼叫工具,但對世界的了解相對有限,因此請為它們搭配檢索,而不是讓它們憑記憶回答事實性問題。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.