Ertas Blog

    Field notes on building custom AI models: fine-tuning, on-device inference, and the cost maths behind owning your own models.

    全部 594 篇文章,依主題分組。
    Industry

    AMD 收購 Taalas:模型專用 AI 晶片

    AMD 於 2026 年 8 月 6 日宣布達成收購 Taalas 的最終協議,距 Nvidia 以約 200 億美元取得 Groq 授權僅八個月。兩家加速器廠商如今都已買下專用推論晶片,本文拆解這對基於開放模型打造產品的開發者意味著什麼。

    Edward Xi Yang
    Comparison

    LFM2.5 規模比較:裝置端 230M、350M 與 1.2B

    Liquid AI 的 LFM2.5 提供三種規模。基準資料、匯出體積,以及我們把其中兩種微調成正式產品時學到的事,包括那個所有指標都沒能發現的失敗。

    Edward Xi Yang
    Product

    獨立開發者的微調:$10 Ertas Lite 方案深入解析

    訓練一個屬於你自己的客製化 AI 模型,最便宜的方式。$10/月為業餘愛好者與獨立開發者解鎖了什麼、可以訓練哪些模型,以及它在哪裡會不夠用。

    Edward Xi Yang
    Insights

    Chatty Valley:《星露谷物語》裝置端 AI 模組(第一部分)

    我如何微調一個 1.2B 裝置端 AI 模型,讓萊納斯在《星露谷物語》裡真的能對話。全程跑在你的 CPU 上,不需要 API 金鑰。這是 Chatty Valley 開發日誌的第一部分。

    Edward Xi Yang
    見解

    Gemma 4 E2B 與 FunctionGemma 270M:工具呼叫

    Google 的 FunctionGemma(270M)與 Gemma 4 E2B(2B)是 2026 年最小的可信函式呼叫模型,作為可微調並直接出貨的基底模型發布。

    Edward Xi Yang
    教學

    手機上的 Llama Stack:以微調 Llama 4 模型自託管 Llama 代理

    Meta 的 Llama Stack 是建構基於 Llama 代理的標準參考架構。將其與微調 Llama 4 衍生模型以及 Swift/Kotlin 用戶端 SDK 結合,你便能獲得完全在使用者手機上執行的完整代理堆疊。

    Edward Xi Yang
    教學

    Mastra + Vercel AI SDK + 裝置端 GGUF:無 API 成本的 TypeScript 行動代理堆疊

    TypeScript 優先的行動建構者不必使用 Python 代理框架。Mastra 與 Vercel AI SDK 加上透過 llama.cpp 在裝置端執行的微調 4B 模型,產生具有零按 token 成本的完整代理堆疊。

    Edward Xi Yang
    見解

    端側工具呼叫對比:Phi-4-Mini、Gemma 4 與 Qwen3-4B

    Phi-4-Mini、Gemma 4 E4B 與 Qwen3-4B 在 BFCL v4 工具呼叫上的成績、手機端延遲和微調後準確率,並給出四個問題的選型決策樹。

    Edward Xi Yang
    教學

    用你的微調本地模型替換 OpenAI Agents SDK 中的 OpenAI

    OpenAI Agents SDK 刻意設計為模型無關。將 OpenAI client 換成在 Ollama 上執行的 Ertas 訓練模型,你便保留開發者體驗的同時消除按 token 成本。直接替換的教學。

    Edward Xi Yang
    教學

    Pydantic AI 裝置端:為型別安全的行動代理微調 Qwen3-4B

    Pydantic AI 為 LLM 代理帶來型別安全與 FastAPI 人體工學。將其與透過 llama.cpp 在裝置端執行的微調 4B 模型結合,你便能在行動 app 中獲得正式上線等級的代理,享有零 API 成本與構造上經驗證的輸出。

    Edward Xi Yang
    比較

    Pydantic AI vs LangGraph:微調代理選哪個框架

    Pydantic AI 給你型別安全的線性代理,LangGraph 給你持久化的有狀態圖。一份 2026 年決策矩陣,以及為什麼微調能讓兩者都變得可靠。

    Edward Xi Yang
    Guides

    Nous Hermes Agent 與 Hermes 4:差別在哪裡

    Nous Research 有兩個產品共用 Hermes 這個名字:2025 年釋出的開放權重模型系列,以及 2026 年釋出的自我改進代理框架。本文說明兩者的差別,以及分別何時該用哪一個。

    Edward Xi Yang
    Industry

    2026 年開源 AI 模型生態全景

    截至 2026 年 4 月的開放權重 AI 模型生態系統全面快照——中國實驗室的主導地位、MoE 架構成為預設選擇、統一思考模式(thinking mode)的浮現,以及這一切對生產環境部署的意義。

    Edward Xi Yang
    Industry

    為什麼中國實驗室如今主導開源 AI

    到了 2026 年 4 月,中國實驗室在綜合智慧基準上拿下開放權重模型的前五名。這個格局並非偶然——它反映的是中美 AI 發展之間,經過多年才顯現的策略性、結構性與經濟性差異。

    Edward Xi Yang
    Technical

    有效上下文長度的問題:為什麼 1M tokens 並不真的是 1M tokens

    宣稱具備 1M 或 10M token 上下文視窗的模型,並不真的能在整個範圍內維持有用的檢索準確度。本文說明「有效上下文」實際代表什麼、為什麼這對生產部署很重要,以及如何在設計上繞過這個落差。

    Edward Xi Yang
    Technical

    2026 年 MoE 混合專家架構

    2026 年 MoE 為何成為旗艦開放權重模型的預設架構、設計選擇如何從 Mixtral 演進到 DeepSeek V4,以及這對生產部署的記憶體、推論成本與微調代表什麼。

    Edward Xi Yang
    Guides

    生產環境 A/B 測試:雲端 API vs 裝置端 AI

    如何在上線行動應用程式中對雲端 API 和裝置端模型進行公平的 A/B 測試。指標、分組設計、統計顯著性以及真正重要的指標。

    Edward Xi Yang
    Guides

    如何為行動應用程式加入 AI:開發者決策指南

    涵蓋在 iOS 和 Android 應用程式中加入 AI 功能的所有方法。雲端 API、裝置端模型和混合架構,搭配實際成本與效能數據完整比較。

    Edward Xi Yang
    Guides

    Android 應用程式的 AI:ML Kit、雲端 API 與裝置端 LLM 比較

    Android 應用程式的三條 AI 路徑。Google ML Kit 用於常見任務,雲端 API 提供完整 LLM 能力,裝置端模型透過 llama.cpp 實現成本與隱私。為 Kotlin 開發者提供的實用比較。

    Edward Xi Yang
    Insights

    當你的應用程式有了使用者,AI API 帳單會暴漲 10 倍

    大多數 AI 教學跳過的成本計算。你的 API 帳單隨每位使用者線性成長,而真實的乘數比定價頁面顯示的更嚴重。以下是 1K、10K 和 100K MAU 時會發生的事。

    Edward Xi Yang
    Insights

    行動裝置 AI API 定價:每位使用者的真實成本

    如何計算每位行動應用程式使用者的 AI 真實成本。供應商比較、隱藏的成本倍增因素,以及決定你的 AI 功能是否可持續的單位經濟學。

    Edward Xi Yang
    Insights

    AI API 速率限制將在規模化時節流你的行動應用程式

    OpenAI、Anthropic 和 Google 的速率限制是為受控使用設計的,不是為了數千名同時使用者的行動應用程式。以下是限制在哪裡觸發以及觸發時會發生什麼。

    Edward Xi Yang
    Insights

    為什麼你的 AI 應用程式感覺很慢:行動裝置 API 延遲

    AI API 呼叫為每次互動增加 500-3,000 毫秒的延遲。在行動裝置上,這就是使用者喜愛的功能和被棄用功能之間的差別。以下是解決辦法。

    Edward Xi Yang
    Insights

    行動使用者真正想要的 AI 功能(2026)

    基於研究的行動應用程式 AI 功能清單,這些功能真正驅動留存和參與。使用者想要什麼、忽略什麼,以及如何根據實際行為資料排定 AI 功能的優先順序。

    Edward Xi Yang

    Deploy custom AI models, no ML expertise required.

    Free plan, no card. Paid plans from $10/mo USD.