Ertas Blog

    Field notes on building custom AI models: fine-tuning, on-device inference, and the cost maths behind owning your own models.

    全部 594 篇文章,按主题分组。
    Industry

    AMD 收购 Taalas:模型专用 AI 芯片

    AMD 于 2026 年 8 月 6 日宣布达成收购 Taalas 的最终协议,距 Nvidia 以约 200 亿美元取得 Groq 授权仅八个月。两家加速器厂商如今都已买下专用推理芯片,本文拆解这对基于开放模型构建产品的开发者意味着什么。

    Edward Xi Yang
    Comparison

    LFM2.5 规模对比:设备端 230M、350M 与 1.2B

    Liquid AI 的 LFM2.5 提供三种规模。基准数据、导出体积,以及我们把其中两种微调成正式产品时学到的东西,包括那个所有指标都没能发现的失败。

    Edward Xi Yang
    Product

    面向独立开发者的微调:$10 的 Ertas Lite 套餐详解

    训练一个你自己拥有的定制 AI 模型的最低成本方式。$10/月 为爱好者和独立开发者解锁了什么、可以训练哪些模型,以及它在哪里不够用。

    Edward Xi Yang
    Insights

    Chatty Valley:星露谷物语的端侧 AI 对话模组(第一部分)

    我微调了一个 1.2B 端侧 AI 模型,让星露谷物语里的莱纳斯能真正跟你聊天。模型随模组本地跑在你的 CPU 上,不需要 API key。这是 Chatty Valley 开发日志的第一部分。

    Edward Xi Yang
    洞察

    Gemma 4 E2B 与 FunctionGemma 270M:工具调用

    Google 的 FunctionGemma(270M)与 Gemma 4 E2B(2B)是 2026 年最小的可信函数调用模型,作为可微调并直接发布的基础模型推出。

    Edward Xi Yang
    教程

    Llama Stack 装进手机:用微调 Llama 4 模型打造自托管 Llama 智能体

    Meta 的 Llama Stack 是基于 Llama 的智能体的标准参考架构。把它与微调的 Llama 4 衍生模型以及 Swift/Kotlin 客户端 SDK 结合,你就得到了完全运行在用户手机上的完整智能体技术栈。

    Edward Xi Yang
    教程

    Mastra + Vercel AI SDK + 设备端 GGUF:无 API 成本的 TypeScript 移动智能体栈

    TypeScript 优先的移动开发者不必使用 Python 智能体框架。Mastra 与 Vercel AI SDK 加上一个通过 llama.cpp 在设备端运行的微调 4B 模型,产出零按 token 成本的完整智能体栈。

    Edward Xi Yang
    洞察

    端侧工具调用对比:Phi-4-Mini、Gemma 4 与 Qwen3-4B

    Phi-4-Mini、Gemma 4 E4B 与 Qwen3-4B 在 BFCL v4 工具调用上的成绩、手机端延迟和微调后准确率,并给出四个问题的选型决策树。

    Edward Xi Yang
    教程

    用你的微调本地模型替换 OpenAI Agents SDK 中的 OpenAI

    OpenAI Agents SDK 刻意保持模型无关。把 OpenAI 客户端换成在 Ollama 上运行的 Ertas 训练模型,你保留开发体验同时干掉按 token 成本。一份直接替换教程。

    Edward Xi Yang
    教程

    Pydantic AI 设备端:微调 Qwen3-4B 打造类型安全的移动智能体

    Pydantic AI 为 LLM 智能体带来类型安全与 FastAPI 工程美感。把它与一个通过 llama.cpp 在设备端运行的微调 4B 模型组合起来,你将在移动应用中获得生产级智能体——零 API 成本,且输出按构造经过验证。

    Edward Xi Yang
    对比

    Pydantic AI vs LangGraph:微调智能体选哪个框架

    Pydantic AI 给你类型安全的线性智能体,LangGraph 给你持久化的有状态图。一份 2026 年决策矩阵,以及为什么微调能让两者都变得可靠。

    Edward Xi Yang
    Guides

    Nous Hermes Agent 与 Hermes 4:区别在哪里

    Nous Research 有两件产品共用 Hermes 这个名字:2025 年发布的开放权重模型家族,以及 2026 年发布的自我改进智能体框架。本文说明两者的区别以及各自的适用场景。

    Edward Xi Yang
    Industry

    2026年开源AI模型生态全景

    截至2026年4月开放权重AI模型生态的全面快照——中国实验室的主导地位、MoE架构成为默认选择、统一思考模式范式,以及这一切对生产环境部署意味着什么。

    Edward Xi Yang
    Industry

    为什么中国实验室如今主导开源AI

    到2026年4月,中国实验室在综合智能基准上占据开放权重模型的前五席。这一格局并非偶然——它反映了中美AI研发之间需要数年才显现的战略、结构与经济差异。

    Edward Xi Yang
    Technical

    有效上下文长度问题:为什么100万Token其实没有100万Token

    宣传具有100万或1000万Token上下文窗口的模型,并不能在整个范围内保持有用的检索准确率。本文讲解"有效上下文"究竟意味着什么、为什么它对生产部署很重要,以及如何针对这一差距进行设计。

    Edward Xi Yang
    Technical

    2026年MoE混合专家架构

    2026年MoE为何成为旗舰开放权重模型的默认架构、设计选择如何从Mixtral演进到DeepSeek V4,以及这对生产部署中的显存、推理成本与微调意味着什么。

    Edward Xi Yang
    Guides

    生产环境 A/B 测试:云端 API vs 端侧 AI

    如何在上线移动应用中对云端 API 和端侧模型进行公平的 A/B 测试。指标、分组设计、统计显著性以及真正重要的指标。

    Edward Xi Yang
    Guides

    如何为移动应用添加AI:开发者决策指南

    涵盖为iOS和Android应用添加AI功能的所有方法的综合指南。云API、端侧模型和混合架构的真实成本与性能数据对比。

    Edward Xi Yang
    Guides

    Android应用中的AI:ML Kit、云API和端侧LLM对比

    Android应用中AI的三条路径。Google ML Kit用于常见任务,云API用于完整LLM能力,llama.cpp端侧模型用于成本和隐私。面向Kotlin开发者的实用比较。

    Edward Xi Yang
    Insights

    当应用获得用户时,你的AI API账单将增长10倍

    大多数AI教程跳过的成本计算。你的API账单随每个用户线性增长,真实的乘数效应比定价页面显示的更糟。以下是1K、10K和100K MAU时会发生什么。

    Edward Xi Yang
    Insights

    移动端 AI API 定价: 每用户的真实成本

    如何计算每个移动应用用户的真实 AI 成本。供应商对比、隐藏的成本倍增因素,以及决定你的 AI 功能是否可持续的单位经济学。

    Edward Xi Yang
    Insights

    AI API 速率限制会在规模化时节流你的移动应用

    OpenAI、Anthropic 和 Google 的速率限制是为受控使用设计的,而非面向数千并发用户的移动应用。限制在哪里被触发以及触发后会发生什么。

    Edward Xi Yang
    Insights

    为什么你的 AI 应用感觉很慢: 移动端 API 延迟

    AI API 调用为每次交互增加 500-3,000ms 的延迟。在移动端,这就是用户喜爱的功能和被弃用功能之间的差距。以下是解决办法。

    Edward Xi Yang
    Insights

    移动用户真正想要的AI功能(2026)

    基于研究数据的AI功能清单,驱动移动应用的留存和参与度。用户想要什么,忽略什么,以及如何根据真实行为数据确定AI功能的优先级。

    Edward Xi Yang

    Deploy custom AI models, no ML expertise required.

    Free plan, no card. Paid plans from $10/mo USD.