Microsoft Foundry Local:能力與局限
Microsoft Foundry Local 在本地硬體上執行 AI 模型,執行時無需雲端連接。本文分析它擅長什麼、在哪裡止步,以及企業還需要補齊哪些環節。
2026 年 2 月,Microsoft 推出 Foundry Local 正式版。它在本地硬體上執行 AI 模型——筆記型電腦、工作站、邊緣設備——執行時無需雲端連接。對於每年從 Azure 雲端服務產生逾 600 億美元的公司,這是一個值得注意的舉動。
這不是一個小型 SDK 版本。結合 Azure Local(本地端基礎設施)和 Microsoft 365 Local(離線生產力),Foundry Local 代表 Microsoft 為斷網和氣隙環境構建完整的主權 AI 堆疊。當最大的雲端供應商告訴客戶「你可以在沒有我們雲端的情況下運行這個」時,市場動態已經改變。
本文涵蓋 Foundry Local 實際上是什麼、其架構是什麼樣子、它能做什麼和不能做什麼,以及企業 AI 買家應該從中得出什麼。
Foundry Local 實際上是什麼
Foundry Local 是一個本地 AI 模型推理框架。它允許開發者和企業直接在本地硬體上執行小型語言模型(SLM)和其他 AI 模型——Windows PC、macOS 機器和邊緣設備——無需將資料傳送到 Azure 或任何其他雲端服務。
它是 Microsoft 所謂的 Azure AI Foundry 生態系統的一部分:
- Azure AI Foundry(雲端):Azure 上的模型目錄、微調、託管推理端點
- Azure AI Foundry SDK:用於與雲端和本地模型互動的統一 Python/C# SDK
- Foundry Local:透過
localhost上的 OpenAI 相容 REST API 服務模型的本地執行時間
關鍵的架構決策:
| 元件 | 實現 |
|---|---|
| 執行時間引擎 | ONNX Runtime(Microsoft 的跨平台 ML 推理引擎) |
| API 介面 | localhost 上的 OpenAI 相容 REST API |
| 模型格式 | 來自 Microsoft 目錄的 ONNX 優化模型 |
| 硬體支援 | NVIDIA GPU(CUDA)、AMD GPU(DirectML)、Intel GPU(DirectML)、Qualcomm NPU、Apple Silicon(Metal) |
| 最低需求 | 8 GB RAM,Windows 10/11 或 macOS |
| 執行時間的網路需求 | 無——支援完全斷網操作 |
OpenAI 相容的 API 很重要。針對 OpenAI API 構建的應用程式可以透過將端點 URL 從 api.openai.com 更改為 localhost 來切換到 Foundry Local。除端點之外沒有程式碼更改。這使已在 OpenAI API 介面上構建的團隊的遷移變得簡單。
完整的 Microsoft 主權堆疊
Foundry Local 不是一個獨立的產品。它適合 Microsoft 針對斷網和主權環境的更廣泛策略:
Azure Local(前身為 Azure Stack HCI)
Azure Local 將 Azure 服務帶到本地端硬體。組織在其自己的資料中心的伺服器上安裝 Azure Local,並在沒有與 Azure 雲端持續連接的情況下執行 Azure 服務(計算、儲存、網路、容器)。對於機密環境和氣隙網路,Azure Local 提供基礎設施層。
Microsoft 365 Local
與 Azure Local 增強功能一起宣佈,Microsoft 365 Local 使 Microsoft 365 生產力應用程式(Word、Excel、Teams、SharePoint)能夠在斷網環境中運行。這意味著電子郵件、文件協作和通訊在沒有網際網路存取的情況下也能運作。
Foundry Local
AI 層。模型在工作站或邊緣設備上本地端執行,透過本地 REST API 服務推理。與用於基礎設施的 Azure Local 和用於生產力的 Microsoft 365 Local 結合,整個企業軟體堆疊可以在沒有任何雲端連接的情況下運行。
組裝後的堆疊樣子
┌─────────────────────────────────────┐
│ 使用者應用程式 │
│ (自訂應用、M365、業務線) │
├─────────────────────────────────────┤
│ Foundry Local(AI 層) │
│ 本地模型推理,REST API │
├─────────────────────────────────────┤
│ Microsoft 365 Local │
│ 生產力,協作 │
├─────────────────────────────────────┤
│ Azure Local(基礎設施層) │
│ 計算,儲存,網路 │
├─────────────────────────────────────┤
│ 客戶擁有的硬體 │
│ 本地端資料中心 / 邊緣 │
└─────────────────────────────────────┘
這是來自單一供應商的完整主權堆疊。任何層都不需要網際網路。對於需要斷網操作的國防、情報、關鍵基礎設施和受監管行業,這是來自主要供應商的第一個在單一架構中涵蓋基礎設施、生產力和 AI 推理的整合產品。
Foundry Local 能做什麼
本地模型推理
Foundry Local 在本地端執行小型語言模型,在所有主要 GPU 和 NPU 架構上提供硬體加速推理。在正式版時,支援的模型包括:
- Phi-4-mini(38 億參數):Microsoft 針對推理優化的旗艦小型模型
- Phi-3.5 系列:針對不同任務優化的各種大小
- Phi-3-vision:用於圖像理解的多模態模型
- 來自 Azure AI 模型目錄的其他模型,ONNX 優化
推理效能取決於硬體。在擁有獨立 GPU(16 GB 以上 VRAM)的現代工作站上,Phi-4-mini 以約 30-50 個 token/秒的速度產生——足夠快用於互動應用程式。在純 CPU 機器上,效能顯著下降,但對批次處理仍然可用。
斷網操作
一旦模型權重被下載和安裝,Foundry Local 就不進行任何網路呼叫。沒有遙測,沒有授權檢查,沒有用戶未明確操作的模型更新。這是真正的斷網操作,而非「大多數時候離線工作」。
對於氣隙環境,模型權重可以在初始設置期間透過批准的可移動媒體傳輸。此後,系統完全從本地儲存運行。
開發者整合
OpenAI 相容的 REST API 意味著現有工具可以使用:
- 使用
openaiPython 套件的 Python 應用程式透過指向http://localhost:PORT運作 - LangChain / LlamaIndex 框架無需自訂適配器即可連接
- n8n / Make.com 自動化工作流程可以針對本地端點
- 使用 HTTP REST 呼叫的自訂應用程式開箱即用