Fine-Tune Magistral with Ertas
Mistral AI 的專用推理模型產品線——Magistral Medium 1.2(magistral-medium-2509)與 Magistral Small 1.2(magistral-small-2509)——專注於延伸的思維鏈能力,後續此產品線整併入 Mistral Small 4。
Overview
Magistral 是 Mistral AI 的專用推理模型產品線,最初於 2025 年發布,是該公司對 DeepSeek-R1 與 QwQ-32B 所建立的專用推理趨勢的回應。此產品線包含 Magistral Small 與 Magistral Medium 兩個變體,目前公開記錄中最新的版本為 2025 年 9 月發布的 Magistral Medium 1.2(`magistral-medium-2509`)與 Magistral Small 1.2(`magistral-small-2509`)。
Magistral 系列強調以強化學習訓練的延伸思維鏈推理,精神上類似於 DeepSeek-R1 的訓練方法論,但具有 Mistral 獨特的後訓練流程,並聚焦於歐洲部署的市場定位。Magistral 模型針對的使用情境是:推理深度比回應速度更為重要的場景,例如數學問題求解、科學分析、複雜程式碼生成,以及結構化審議任務。
2026 年 3 月,Mistral 宣布整併其模型產品線:Magistral(推理)、Devstral(程式設計代理)與 Mistral Small(指令遵循)統一為單一的 Mistral Small 4 檢查點。此整併標誌著 Magistral 作為獨立產品線的終結,但對於偏好專用推理行為勝於 Mistral Small 4 混合方法的部署情境,Magistral Medium 與 Small 變體仍可取得。
對於 2026 年評估 Mistral 推理能力的團隊而言,Mistral Small 4 是建議的後續路徑。Magistral 仍提供文件支援,並支援整併前已採用此產品線的穩定生產部署。
Key Features
專用推理訓練是 Magistral 最初的差異化優勢。透過強化學習訓練並強調思維鏈生成,Magistral 模型會在最終答案前產生延伸的推理軌跡——模式類似於 DeepSeek-R1 與 QwQ-32B,但具有 Mistral 特有的後訓練特性。
聚焦歐洲部署的市場定位對部分團隊而言是有意義的優勢。Mistral AI 總部位於歐盟,具有強大的資料主權定位,使 Magistral 對受監管或政治偏好非美國/非中國 AI 供應商的歐洲組織具有吸引力。此定位也延續至 Mistral Small 4。
Small/Medium 雙層結構提供部署靈活性。Magistral Small 以單 GPU 部署成本處理一般推理工作負載;Magistral Medium 則在多 GPU 伺服器規模下提供更高的峰值品質。此範圍讓團隊能根據實際部署基礎設施選擇合適的推理模型大小。
Mistral 在後訓練專業上的傳承反映在 Magistral 的指令遵循穩定性與工具使用保真度上。雖然專用推理模型在代理部署中有時會不穩定(推理模式可能干擾結構化輸出),但 Magistral 在工程上是針對生產可靠性而非單純的基準效能進行設計的。
Fine-Tuning with Ertas
Magistral Small 在 Ertas Studio 中以 QLoRA 在典型序列長度下使用 24-48GB GPU 即可有效微調。Magistral Medium 由於參數量較大,需要多 GPU 伺服器進行微調。
專門針對推理模式的微調,Ertas Studio 支援包含明確思維鏈軌跡的訓練資料格式。在訓練資料中包含思考軌跡,能保留微調模型的專用推理行為,避免崩塌為直接回應模式。