2026 年的混合專家:從 Mixtral 到 DeepSeek V4
MoE 已成為 2026 年旗艦開放權重模型的預設架構——DeepSeek V4、Kimi K2.6、MiMo V2.5 Pro、GPT-OSS、Mistral Small 4 全都採用。本文說明原因、設計選擇如何演進,以及這對生產部署代表什麼。
兩年前,混合專家(MoE)還是少數前沿實驗室在試探性探索的實驗性架構選擇。Mixtral 8x7B 之所以成為新聞,正是因為它不尋常。到了 2026 年 4 月,MoE 已成為旗艦開放權重模型的預設架構。目前開放權重頂層的每一款模型——DeepSeek V4、Kimi K2.6、MiMo V2.5 Pro、GPT-OSS-120B、Mistral Small 4、Qwen 3.5-397B-A17B——都採用 MoE 架構。70B 以上的純稠密模型愈來愈是例外,而非常態。
本文涵蓋哪些東西改變了、架構選擇如何演進,以及這個轉變對 2026 年做生產部署決策的團隊代表什麼。
基本概念(給 MoE 的新讀者)
標準的 transformer 層對每個 token 套用相同的前饋計算。一個 70B 參數的稠密模型,對它處理的每個 token 都使用全部 70B 參數——對任一給定 token,多數參數其實無關,但架構仍會啟用全部。
混合專家層把單一前饋區塊換成多個並行的「專家」加上一個小型路由網路。對每個 token,路由器決定哪些專家(通常是數十或數百中的 1-8 個)處理它,且只有那些專家被啟用。該層的總參數量是所有專家的總和,但任一單一 token 的啟用參數量小得多。
實務效果是:一個 1T 參數的 MoE 模型搭配 32B 啟用參數,其推論成本相當於 32B 稠密模型——token 產生吞吐量、GPU 利用率、延遲大致都是 32B 稠密模型的水平。但模型有 1T 參數的容量可用,且路由器會學到把不同類型 token 路由到不同的專門化專家。當訓練順利時,結果是一個推論經濟性大幅更佳、品質可媲美較大稠密模型的模型。
代價是:總記憶體占用會隨總參數量擴展,而非啟用參數量。即便每個 token 只啟用一部分,你仍須把所有專家權重載入記憶體。這通常代表 MoE 模型在等價推論成本下,比稠密模型需要更多 VRAM。
Mixtral 時代(2023 年末 – 2025 年初)
Mistral 推出的 Mixtral 8x7B(2023 年 12 月)與 Mixtral 8x22B(2024 年 4 月),在開放權重生態中確立了 MoE 模式。兩者皆使用 8 個專家中 top-2 的路由策略,啟用參數量分別約 12.9B 與 39B,對應總計 46.7B 與 141B。
Mixtral 模型確立了幾個重要慣例:
Top-K 路由。 每個 token 被路由到固定 K 個專家(Mixtral 為 top-2)。這在平行性(你可以同時計算多個專家)與效率(更多專家代表每個 token 計算量更大)之間取得平衡。
負載平衡。 路由器學會大致均勻地把 tokens 分配到各專家。沒有明確的負載平衡壓力,MoE 訓練容易塌陷成少數「熱門」專家承擔多數 tokens——使「擁有 許多專家」失去意義。Mixtral 引入了訓練時的輔助負載平衡損失以防止塌陷。
專家維度與稠密層相符。 Mixtral 的專家具有與等價稠密前饋區塊相同的隱藏維度。這讓架構在概念上很簡單:一個 MoE 層「就是一個有多份並行副本與一個路由器的稠密層」。
Mixtral 模型展示了 MoE 能在有利的推論經濟性下達成有競爭力的品質,但它們探索的設計空間相對狹窄。後續工作大幅擴張了該空間。
細粒度 MoE 時代(2025 年中 – 2026 年)
DeepSeek V3(2024 年 12 月)與 Qwen 3 系列(2025 年初)開啟了實質不同的 MoE 設計模式:細粒度 MoE。關鍵轉變是使用更多、更小的專家,且每個 token 路由到更多專家。
DeepSeek V3 架構每層使用 256 個路由專家加 1 個共享專家、top-8 路由。相對於 Mixtral 的 8 個專家、top-2 路由,這是個根本不同的設計空間:
- 更多專家代表每個專家可更狹窄地專門化
- 較小專家代表每個專家計算更便宜
- 更高的 top-K 代表每個 token 看見更多元的專家貢獻
- 共享專家擷取共通模式,無須在所有路由專家間複製