AMD 收购 Taalas:模型专用 AI 芯片
AMD 于 2026 年 8 月 6 日宣布达成收购 Taalas 的最终协议,距 Nvidia 以约 200 亿美元取得 Groq 授权仅八个月。两家加速器厂商如今都已买下专用推理芯片,本文拆解这对基于开放模型构建产品的开发者意味着什么。
Field notes on building custom AI models: fine-tuning, on-device inference, and the cost maths behind owning your own models.
全部 594 篇文章,按主题分组。AMD 于 2026 年 8 月 6 日宣布达成收购 Taalas 的最终协议,距 Nvidia 以约 200 亿美元取得 Groq 授权仅八个月。两家加速器厂商如今都已买下专用推理芯片,本文拆解这对基于开放模型构建产品的开发者意味着什么。
Liquid AI 的 LFM2.5 提供三种规模。基准数据、导出体积,以及我们把其中两种微调成正式产品时学到的东西,包括那个所有指标都没能发现的失败。
训练一个你自己拥有的定制 AI 模型的最低成本方式。$10/月 为爱好者和独立开发者解锁了什么、可以训练哪些模型,以及它在哪里不够用。
我微调了一个 1.2B 端侧 AI 模型,让星露谷物语里的莱纳斯能真正跟你聊天。模型随模组本地跑在你的 CPU 上,不需要 API key。这是 Chatty Valley 开发日志的第一部分。
Google 的 FunctionGemma(270M)与 Gemma 4 E2B(2B)是 2026 年最小的可信函数调用模型,作为可微调并直接发布的基础模型推出。
Meta 的 Llama Stack 是基于 Llama 的智能体的标准参考架构。把它与微调的 Llama 4 衍生模型以及 Swift/Kotlin 客户端 SDK 结合,你就得到了完全运行在用户手机上的完整智能体技术栈。
TypeScript 优先的移动开发者不必使用 Python 智能体框架。Mastra 与 Vercel AI SDK 加上一个通过 llama.cpp 在设备端运行的微调 4B 模型,产出零按 token 成本的完整智能体栈。
Phi-4-Mini、Gemma 4 E4B 与 Qwen3-4B 在 BFCL v4 工具调用上的成绩、手机端延迟和微调后准确率,并给出四个问题的选型决策树。
OpenAI Agents SDK 刻意保持模型无关。把 OpenAI 客户端换成在 Ollama 上运行的 Ertas 训练模型,你保留开发体验同时干 掉按 token 成本。一份直接替换教程。
Pydantic AI 为 LLM 智能体带来类型安全与 FastAPI 工程美感。把它与一个通过 llama.cpp 在设备端运行的微调 4B 模型组合起来,你将在移动应用中获得生产级智能体——零 API 成本,且输出按构造经过验证。
Pydantic AI 给你类型安全的线性智能体,LangGraph 给你持久化的有状态图。一份 2026 年决策矩阵,以及为什么微调能让两者都变得可靠。
Nous Research 有两件产品共用 Hermes 这个名字:2025 年发布的开放权重模型家族,以及 2026 年发布的自我改进智能体框架。本文说明两者的区别以及各自的适用场景。
截至2026年4月开放权重AI模型生态的全面快照——中国实验室的主导地位、MoE架构成为默认选择、统一思考模式范式,以及这一切对生产环境部署意味着什么。
到2026年4月,中国实验室在综合智能基准上占据开放权重模型的前五席。这一格局并非偶然——它反映了中美AI研发之间需要数年才显现的战略、结构与经济差异。
宣传具有100万或1000万Token上下文窗口的模型,并不能在整个范围内保持有用的检索准确率。本文讲解"有效上下文"究竟意味着什么、为什么它对生产部署很重要,以及如何针对这一差距进行设计。
2026年MoE为何成为旗舰开放权重模型的默认架构、设计选择如何从Mixtral演进到DeepSeek V4,以及这对生产部署中的显存、推理成本与微调意味着什么。
如何在上线移动应用中对云端 API 和端侧模型进行公平的 A/B 测试。指标、分组设计、统计显著性以及真正重要的指标。
涵盖为iOS和Android应用添加AI功能的所有方法的综合指南。云API、端侧模型和混合架构的真实成本与性能数据对比。
Android应用中AI的三条路径。Google ML Kit用于常见任务,云API用于完整LLM能力,llama.cpp端侧模型用于成本和隐私。面向Kotlin开发者的实用比较。
大多数AI教程跳过的成本计算。你的API账单随每个用户线性增长,真实的乘数效应比定价页面显示的更糟。以下是1K、10K和100K MAU时会发生什么。
如何计算每个移动应用用户的真实 AI 成本。供应商对比、隐藏的成本倍增因素,以及决定你的 AI 功能是否可持续的单位经济学。
OpenAI、Anthropic 和 Google 的速率限制是为受控使用设计的,而非面向数千并发用户的移动应用。限制在哪里被触发以及触发后会发生什么。
AI API 调用为每次交互增加 500-3,000ms 的延迟。在移动端,这就是用户喜爱的功能和被弃用功能之间的差距。以下是解决办法。
基于研究数据的AI功能清单,驱动移动应用的留存和参与度。用户想要什么,忽略什么,以及如何根据真实行为数据确定AI功能的优先级。
Deploy custom AI models, no ML expertise required.
Free plan, no card. Paid plans from $10/mo USD.