Fine-Tune LFM2.5 230M with Ertas

    LFM2.5-230M 是 Ertas 目錄中最小的基礎模型,由 LFM2.5-350M 蒸餾而來,在 BFCLv3 函式呼叫上取得 43.26。量化後匯出體積為 153MB,在樹莓派 5 上僅占用 293MB,因此當下載體積本身就是限制條件時,它就是應當選擇的模型。

    230MLiquid AI

    LFM2.5 230M at a Glance

    完整名稱LFM2.5-230M
    開發方Liquid AI
    參數量230M
    層數14 層(8 個雙閘控卷積區塊 + 6 個 GQA 區塊)
    訓練預算19 兆 token,含 32K 上下文擴展階段
    後訓練由 LFM2.5-350M 蒸餾,隨後經 DPO 與多領域強化學習
    上下文長度32,768 token
    詞表大小65,536
    知識截止2024 年年中
    支援語言英語、阿拉伯語、中文、法語、德語、義大利語、日語、韓語、葡萄牙語、西班牙語
    發布日期2026 年 6 月 25 日
    授權條款LFM Open License v1.0(lfm1.0)
    在 Ertas 上微調所需 GPU 層級T4
    可在 Ertas 免費方案上訓練
    Q4_K_M 匯出體積153 MB
    Ertas 鏡像ErtasAI/LFM2.5-230M

    Overview

    LFM2.5-230M 是 Liquid AI LFM2.5 家族中最小的模型,也是 Ertas 目錄中最小的基礎模型。它發布於 2026 年 6 月 25 日,採用 14 層結構,按 8 個雙閘控短程卷積區塊與 6 個分組查詢注意力區塊劃分,比更大的同門少兩個卷積區塊,預訓練量為 19 兆 token,其中包含一個專門的 32K 上下文擴展階段。

    它是蒸餾出來的,而不是在這個規模上從零訓練的。Liquid 先做了自 LFM2.5-350M 蒸餾的監督式微調,然後是直接偏好最佳化,再來是多領域強化學習。正是這條流程,讓一個 230M 的模型在函式呼叫上逼近它 350M 的教師模型:BFCLv3 為 43.26 對 44.11,BFCLv4 為 21.03 對 21.86。

    與規模相近的其他模型相比,結果同樣站得住。IFEval 上它取得 71.71,而體量明顯更大的 Gemma 3 1B IT 為 63.49、Qwen3.5-0.8B 為 59.94。IFBench 上為 38.40 對 20.33 與 22.87。BFCLv3 上為 43.26,Gemma 3 1B IT 為 16.61。CaseReportBench 上為 22.51 對 2.28。

    語言涵蓋是家族中最廣的,共十種:英語、阿拉伯語、中文、法語、德語、義大利語、日語、韓語、葡萄牙語與西班牙語。上下文視窗與 350M 及 1.2B 一致,為 32,768 token,詞表為 65,536。

    量化到 Q4_K_M 後匯出體積為 153MB。這個數字就是這個模型存在的全部意義:它小到可以在網頁裡下載完成,小到可以打包進行動應用程式而不必討論體積,也小到可以和樹莓派上正在跑的其他東西共處。Liquid 推薦將其用於資料擷取與輕量級裝置端代理流程,並建議避開推理密集型工作:高階數學、程式碼產生與創意寫作。Ertas 目錄收錄的鏡像位址為 `ErtasAI/LFM2.5-230M`。

    Key Features

    在 230M 參數上守住 BFCLv3 43.26,是最值得說的一點。它 350M 的教師模型為 44.11,Granite 4.0-H-350M 為 43.07,也就是說蒸餾幾乎把全部函式呼叫能力帶下了一個規模級距。參數量約為其四倍的 Gemma 3 1B IT,在同一基準上只有 16.61。

    指令遵循比世界知識更能挺過這次縮小。IFEval 的 71.71 與 IFBench 的 38.40 都接近 350M 的 76.96 與 40.69。規模的代價體現在 MMLU-Pro 的 20.25 與 GPQA Diamond 的 25.41 上,而 Qwen3.5-0.8B 以 37.42 拿下 MMLU-Pro。這個分化正是理解這個模型的關鍵:它照你說的做,但知道的相對不多,所以把事實放進提示詞裡。

    部署資料是目錄中其他模型無法企及的。在 Samsung Galaxy S25 Ultra 上占用 375MB,預填充 1,158 token/秒,解碼 213 token/秒。在樹莓派 5 上以 4-bit 量化、2K 上下文執行時占用 293MB,預填充 523,解碼 42。在 H100 上,512 token 的提示詞在並行為 1 時約 50ms 完成,並行為 64 時約 205ms。

    在這個規模下,瀏覽器部署是真正可行的。匯出為 ONNX 並量化到 q4 之後,模型可透過 transformers.js 載入並在 WebGPU 上執行,以 WASM 作為後備,這意味著一個無伺服器、無按次呼叫成本的 AI 功能。[playground.ertas.ai](https://playground.ertas.ai) 上的 Corporate Goblin 正是如此:它是這個基礎模型的 LoRA 微調版本,合併後匯出為 q4 ONNX,完全在訪客自己的機器上執行。

    Fine-Tuning with Ertas

    LFM2.5 230M 在 Ertas Studio 的 T4 層級上微調,是目錄中訓練成本最低的模型。它原生支援 bf16,因此直接以 bf16 訓練。免費方案可以輕鬆涵蓋它。

    適用於這個規模的配方是:學習率 3e-4 到 5e-4,批次大小 4,梯度累積 2,訓練 8 到 16 個輪次。在 230M 參數下,幾百行資料的一次訓練結束得夠快,以至於訓練步驟不再是你等待的對象,資料集品質成為唯一真正重要的變數。

    匯出結果可以是供 llama.cpp、Ollama 與 LM Studio 使用的 GGUF,也可以是 safetensors LoRA 轉接器。Q4_K_M 匯出約為 153MB。若用於瀏覽器部署,可將轉接器合併後轉換為 q4 ONNX 供 transformers.js 使用。

    Corporate Goblin 是我們自己的實例。它是 LFM2.5-230M 的 LoRA 微調版本,被訓練成對任何提示詞都以同一個固定人設作答,拒絕正常回答並以角色口吻岔開話題。它在 [playground.ertas.ai](https://playground.ertas.ai) 的瀏覽器中執行,訪客的任何輸入都不會離開裝置。它留下的經驗是:只要任務夠窄、資料集在這一點上夠一致,一個 230M 的模型守住一個明確人設的能力遠超參數量給人的印象。

    需要提前規劃的限制是對話記憶。這麼小的模型在每次請求彼此獨立時狀態最好。如果你的微調需要模型跨多輪追蹤狀態,請盡早寫一套腳本化的多輪探針,並對著真實對話執行它,而不是依賴單輪指標。在我們對同家族的測試中,自動化面向在一個其實跟不住話題的規模上依然乾淨,只有對話才把問題揭露出來。

    Use Cases

    瀏覽器端 AI 是這個模型解鎖的情境。量化後 153MB 是合理的首次載入體積,透過 transformers.js 在 WebGPU 上完全在用戶端執行。這一步同時移除了伺服器、按次呼叫成本與隱私討論,也因此改變了什麼東西值得做。

    大規模資料擷取是 Liquid 自己的首要推薦。每份文件都是獨立請求,答案來自文字,模型的工作是產出一致的格式。在 H100 上 512 token 提示詞約 50ms 的延遲下,把它跑遍一個大型語料的成本低到不值得單列成一項開銷。

    輕量級裝置端代理在這個規模下可行,因為函式呼叫能力挺過了蒸餾。BFCLv3 的 43.26 加上原生 Python 式呼叫格式,意味著一個本機代理能從一組不大的工具中選對工具,而這往往就是嵌入式助理需要做的全部。

    嵌入式與物聯網部署是實際可行的。樹莓派 5 上 293MB、解碼 42 token/秒,涵蓋了從智慧家庭裝置到工業感測器再到自助服務機的一大類硬體,而 1B 模型在這些地方會很吃力。

    常駐型行動功能同樣與這個占用相稱。背景分類、裝置端搜尋排序、自動完成與內容歸類可以在 375MB 下持續執行,而更大模型的記憶體與電量代價會直接排除這種做法。

    應當另尋他路的情境:多輪對話、程式碼產生、數學、創意寫作,以及任何需要世界知識的任務。Liquid 直接這麼說,MMLU-Pro 的 20.25 就是背後的數字。若需要同家族中的對話能力,[LFM2.5 1.2B](/models/lfm2-5-1-2b) 才是能跟住話題的規模。

    Hardware Requirements

    推論,依據 Liquid AI 的實測資料。搭載 Snapdragon Gen4 的 Samsung Galaxy S25 Ultra:預填充 1,158 token/秒,解碼 213 token/秒,記憶體 375MB。樹莓派 5,4-bit 量化、2K 上下文:預填充 523,解碼 42,占用 293MB。在單張 H100 上以 512 token 輸入、32 token 輸出批次服務時,並行為 1 時 p50 延遲約 50ms,並行為 64 時約 205ms。

    匯出體積,讀取自 Liquid 公布的 GGUF 建置:Q4_0 為 149MB,Q4_K_M 為 153MB,Q5_K_M 為 172MB,Q6_K 為 191MB,Q8_0 為 247MB,BF16 為 462MB。在這個規模下,從 Q4_K_M 提到 Q6_K 只多 38MB,因此值得測一測額外的品質在實際上是不是幾乎免費。

    在 Ertas 上微調時,T4 層級綽綽有餘。它是入門層級,也是免費方案使用的層級。

    若在 Ertas 之外於本機微調,230M 的 QLoRA 幾乎能放進任何現代消費級 GPU,包括 6GB 顯示卡與許多近期的筆電。這個規模的訓練通常以分鐘計,而不是小時。

    Frequently Asked Questions

    LFM2.5 230M 是什麼?
    LFM2.5-230M 是 Liquid AI 於 2026 年 6 月 25 日發布的最小裝置端語言模型。它擁有 2.3 億參數、14 層結構,混合了 8 個雙閘控卷積區塊與 6 個分組查詢注意力區塊,上下文視窗為 32,768 token。它以 19 兆 token 預訓練,隨後由 LFM2.5-350M 蒸餾而來,並經直接偏好最佳化與多領域強化學習精修。
    230M 的模型真的能做函式呼叫嗎?
    可以。在 Liquid AI 公布的結果中,LFM2.5-230M 的 BFCLv3 為 43.26,BFCLv4 為 21.03。它 350M 的教師模型為 44.11 與 21.86,也就是說蒸餾保留了幾乎全部能力。作為對照,參數量約為其四倍的 Gemma 3 1B IT 在 BFCLv3 上只有 16.61。
    微調後的 LFM2.5 230M 匯出檔案有多大?
    依據 Liquid AI 公布的 GGUF 建置,Q4_K_M 下約為 153MB。Q5_K_M 為 172MB,Q6_K 為 191MB,Q8_0 為 247MB。這是 Ertas 從目錄中任何基礎模型產出的最小匯出檔案。
    LFM2.5 230M 能在網頁瀏覽器裡執行嗎?
    可以。匯出為 ONNX 並量化到 q4 之後,它透過 transformers.js 在 WebGPU 上於用戶端執行,並以 WASM 作為後備。playground.ertas.ai 上的 Corporate Goblin 就是這個基礎模型的 LoRA 微調版本在做這件事,全程沒有伺服器參與,訪客輸入的任何內容都不會離開其裝置。
    LFM2.5 230M 不適合做什麼?
    Liquid AI 不推薦將其用於推理密集型負載:高階數學、程式碼產生與創意寫作。另一個需要提前規劃的邊界是多輪對話,因為這個規模的模型在每次請求彼此獨立時狀態最好。MMLU-Pro 上 20.25 對 Qwen3.5-0.8B 的 37.42 直接顯示了世界知識的差距,因此請為它搭配檢索,而不是讓它憑記憶回答事實性問題。
    在 Ertas 上微調 LFM2.5 230M 是免費的嗎?
    是的。以 2.3 億參數計,它是目錄中最小、訓練成本最低的基礎模型,在 T4 GPU 層級上訓練,並且遠低於免費方案的 5B 參數上限。

    Supported Quantizations

    Q4_0Q4_K_MQ5_K_MQ6_KQ8_0F16BF16

    Related Resources

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.