Back to blog
    amdtaalasnvidiagroqinference-hardwareasicfine-tuningindustry-analysis

    AMD 收购 Taalas:模型专用 AI 芯片

    AMD 于 2026 年 8 月 6 日宣布达成收购 Taalas 的最终协议,距 Nvidia 以约 200 亿美元取得 Groq 授权仅八个月。两家加速器厂商如今都已买下专用推理芯片,本文拆解这对基于开放模型构建产品的开发者意味着什么。

    Edward Xi Yang

    AMD 于 2026 年 8 月 6 日宣布达成收购 Taalas 的最终协议,条款未公开,且须获得监管批准。Taalas 把特定模型的权重直接烧进芯片本身。八个月前,Nvidia 以据报约 200 亿美元取得了 Groq 推理架构的授权。两家加速器厂商如今都已买下专用推理芯片。

    以下是两笔交易各自买到了什么,以及这对基于开放模型构建产品的人意味着什么。

    AMD 到底买了什么?

    AMD 买下的是一家 2023 年成立于多伦多的公司,其芯片把训练好的模型权重直接编码进硅片,而不是在运行时从内存加载。AMD 在自己的公告中表示,将把该技术整合进其加速器路线图,并与 AMD Instinct GPU 一起开发系统级解决方案。AMD 人工智能部门负责人 Vamsi Boppana 将这次收购描述为带来“差异化的推理性能与效率”。

    更值得玩味的解读关乎人和周期时间。Futurum 的分析认为,AMD 买的是一支精通其自有指令集的团队,外加一套已被验证的、能压缩芯片设计周期的能力。Taalas 的创始人出自 Tenstorrent 和 AMD。他们公开的做法是针对每个模型定制约 100 层金属层中的 2 层,这正是台积电能在大约两个月内产出一颗模型专用芯片的原因。一支 24 人的团队以约 3,000 万美元的实际支出做出了可运行的硅片,而这个领域的芯片项目预算通常是九位数。所有数字均为 2026 年 8 月的资料。

    Taalas 联合创始人 Ljubisa Bajic 表示,加入 AMD 让团队获得“加速创新所需的规模、工程资源与全球影响力”。

    这与 Nvidia 收购 Groq 有何不同?

    两者都是加速器厂商在获取专用推理技术,而交易结构的差异很关键。Nvidia 取得的是授权并招揽了对方的管理层。AMD 则是整家买下。

    属性Nvidia 与 GroqAMD 与 Taalas
    宣布日期2025 年 12 月 24 日2026 年 8 月 6 日
    交易结构非独家授权收购协议
    报道金额200 亿美元未公开
    核心技术LPU 推理架构权重烧进硅片
    专用化程度快速通用推理一颗芯片一个模型
    2026 年 8 月状态管理层已加入待监管批准

    两个日期构成的模式才是重点:在八个月内,卖出几乎全部 AI 训练芯片的两家公司,都出钱买下了自己没有造出来的推理芯片。

    什么是模型专用芯片?

    模型专用芯片是指其物理设计直接编码了某一个训练好的模型的权重,因此它只能运行那一个模型。Taalas HC1 是目前最清晰的例子:一颗台积电 N6 制程、拥有 530 亿个晶体管的芯片,把 Llama 3.1 8B 放进掩膜 ROM,其中单个晶体管同时承担存储与计算。

    去掉加载权重这一步,就等于为这一个模型去掉了内存墙,而推理的时间和功耗大部分正是消耗在那里。Taalas 声称每用户每秒约 17,000 个 token,功耗约 200 瓦。该数字是厂商自己的声明,未经独立验证,因此应当视为一个方向而非基准成绩。

    这条路线的代价也完全在意料之中。只跑一个模型的芯片就只能跑一个模型。每一次权重更新、每一个新的基础模型、每一次架构变动都需要新的硅片,这也是为什么两个月的流片周期比峰值吞吐数字更重要。

    为什么有人要把模型烧进芯片?

    因为通用性很贵,而当量大到一定程度,这笔钱就不值得再付。GPU 的能耗预算大部分花在把权重在内存和计算单元之间搬来搬去,以便它能运行你加载的任何模型。如果你已经知道接下来要把哪个模型跑上一百亿次,那份灵活性就是你一直在付钱却从未用到的开销。

    这与当年催生专用视频解码器、网络处理器,以及如今每部手机里的神经引擎的逻辑完全相同。只要一种工作负载同时变得庞大且稳定,这个模式就会出现。我们在关于 HC1 的原文中更深入地讨论了这一历史脉络

    HC1 现在会怎样?

    关于 HC1 单独销售或 chatjimmy.ai 测试版 API 服务,目前没有任何公告。Futurum 的分析预期 HC1 产品线不会原封不动地延续,团队更可能的任务是优化客户的工作负载,比照 AMD 与 Meta 的协同设计模式。SiliconANGLE 报道指出,HC2 瞄准约 200 亿参数规模的模型。

    Taalas 以独立公司身份发布过一份路线图:2026 年春季在 HC1 上推出中等规模推理模型,2026 年冬季在 HC2 上推出前沿模型。如今这些工作已纳入他人的产品线,请把那些日期读作意向。

    如果你基于开放模型构建产品,这意味着什么?

    它奖励的策略位置,是拥有一个值得为其做专用化的模型。两笔交易都在押注:推理负载正变得足够具体,具体到值得为它做专用硬件;而硬件上的专用化只有在其上运行的东西既稳定又高频时才划算。通过 API 调用的通用模型两者都不是。

    由此对开发者有三点推论,而且没有一点需要你去买这些硬件。

    模型是持久资产,硬件是变量。 芯片路线图会继续变动,厂商会继续整合,你今天选定的部署目标三年后多半不是你在跑的那个。用你自己的数据训练出来的模型能挺过这一切,因为它是一个归你所有的文件。这正是我们主张训练一个尺寸合适的模型,而不是租用一个前沿模型的原因。

    小而专是硬件正在走的方向。 HC1 烧进的是一个 8B 模型,据报 HC2 瞄准约 20B。两者都远低于前沿规模,这告诉你芯片设计者认为生产环境的推理实际上长什么样。如果你的部署计划假设自己永远会调用可用的最大模型,那么硬件趋势正在离你而去。

    按 token 计价在规模上越来越站不住脚。 专用推理芯片的全部论据在于:大规模的重复推理本质上是一个披着可变成本外衣的固定成本问题。这与按 token 计费的 API 在用量变得可预测之后就变贵是同一套算术。

    现在该做什么?

    这两笔交易都不要求你立刻行动,因为这些芯片今天都还买不到。它们真正证明合理的,是趁硬件尘埃落定之前把模型这一侧整理好。

    1. 把数据集建起来。 这里描述的每一条部署路径,从笔记本上的 GGUF 到假想中的烧录芯片,起点都是一个用只有你才有的数据训练出来的模型。这项资产建设周期最长,也是唯一没人能卖给你的部分。
    2. 按你实际要部署的尺寸去训练和评估。 如果答案是 4B 或 8B,现在就搞清楚,而不是在你已经围绕前沿模型的质量做完设计之后。
    3. 保持适配器可移植。 LoRA 适配器可以干净地合并回基础权重,这让你在不同运行时之间保有选择余地。我们另外讨论了尺寸与速度的权衡
    4. 别理会峰值吞吐数字。 每秒 17,000 个 token 的说法描述的是单一模型上的最佳情况。决定你能部署什么的是你的质量标准,而这远在硬件之前就已经生效。

    常见问题

    AMD 完成对 Taalas 的收购了吗?

    没有。AMD 于 2026 年 8 月 6 日宣布达成最终协议,该交易仍须符合惯例的交割条件并取得监管批准。外部报道指出预计于 2026 年第四季度完成交割。截至 2026 年 8 月,这是一桩已宣布而非已完成的收购。

    AMD 花了多少钱收购 Taalas?

    AMD 未公开财务条款,其公告与投资者材料中都没有出现任何金额。作为规模参照,截至 2026 年 2 月,Taalas 累计融资 2.19 亿美元,其中包括来自 Quiet Capital、Fidelity 以及半导体投资人 Pierre Lamond 的 1.69 亿美元一轮。

    Nvidia 与 Groq 的交易和 AMD 与 Taalas 的交易有什么区别?

    Nvidia 取得的是 Groq LPU 推理架构的非独家授权,据报价值 200 亿美元,并招揽了 Groq 的管理层。AMD 则是整家收购 Taalas。技术路线也不同:Groq 的 LPU 加速的是通用推理,而 Taalas 把某一个特定模型编码进芯片。

    模型专用芯片会让微调变得多余吗?

    模型专用芯片让微调更有价值,因为围绕单一模型打造的芯片,只有在那个模型值得大量运行时才值得制造。这要求模型专用到足以产生价值,稳定到足以长期使用。微调正是让模型同时具备这两点的方法。

    我今天能在 Taalas HC1 上运行微调过的模型吗?

    在你自己的硬件上不行。HC1 从未开放本地采购,Taalas 提供的是测试版 API 服务形式的推理。自 AMD 达成协议以来,关于该服务尚无任何公告。若要在今天运行微调模型,实际可行的路径是在自己的机器上使用 GGUF 导出

    简短版

    两家加速器厂商花了八个月和大量金钱,得出了同一个结论:推理是与训练不同的问题,而且它正在专用化。针对这一点的硬件答案还会不断易主,这两笔交易以及后续的交易都会证明这一点。

    用你自己的数据训练出来的模型置身事外。它是一个归你所有的文件,能比本文提到的任何一笔交易活得更久。Ertas 的存在就是为了让这一部分在没有 ML 团队的情况下也做得到:准备数据集,可视化训练,导出为 GGUF 或 LoRA 适配器,然后部署到硬件最终落脚的地方。


    资料来源:AMD 新闻室Groq 新闻室Futurum GroupSiliconANGLEVentureBeat。所有数字于 2026 年 8 月 11 日核实。

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading