taalashc1llamainference-hardwareloraedge-aifine-tuningasic
Taalas HC1:Llama 芯片的规格、速度与成本
Taalas 把 Llama 3.1 8B 烧进了硅片:每秒 17,000 个 token,每百万 token 约 0.0075 美元,支持 LoRA 适配器,目前仍不对外销售硬件。
Edward Xi Yang
一家名为 Taalas 的加拿大初创公司做了一件听起来不可能的事:把 Meta 的 Llama 3.1 8B 模型直接硬连线进了一颗芯片。他们在一块 815mm² 的裸片上,把模型权重蚀刻进 530 亿个晶体管里。
结果是每用户每秒 17,000 个 token。这比市面上其他任何方案快约 8 到 74 倍,其中包括 Nvidia 的 H200、Groq 的 LPU 和 Cerebras 的晶圆级引擎。
最有意思的一点在于,尽管是硬连线的,HC1 依然支持 LoRA 微调。这改变了我们看待微调在 AI 技术栈中所处位置的方式。
Taalas 到底造了什么
HC1 是一颗采用台积电 6nm 制程制造的专用集成电路(ASIC)。每一颗 GPU 的做法都是用通用算力从内存里读取权重来运行模型,而 Taalas 把 Llama 3.1 8B 的架构直接编译进了硅片。
关键规格: