繼續消化本屆 Build 大會資訊,這篇要看的是新發佈的七款微軟自家研發 AI 模型,涵蓋推理、程式開發、影像、語音,與 GPT 模型重疊,意味微軟會從完全依賴 OpenAI 轉型為走自己的路。

微軟的 AI 部門 (Microsoft AI) 有註冊自己的獨立域名,就叫 microsoft.ai 😄,自研模型未來會用在 Office、Teams 等產品,目前也已加入 Github Copilot 的可選模型清單,應該有機會用到,稍微認識一下也好。

目前公開的資訊不算多,所以我從官方公告 Building a hill-climbing machine: Launching seven new MAI models 出發一窺究竟。

  1. MAI-Thinking-1
    本波的旗艦推理模型,中等規模 (35B 活躍參數、總參數 1T,MoE 混合專家模型) ,在軟體工程基準盲測中表現優於 Sonnet 4.6。 模型從乾淨資料從零開始訓練,沒有採用蒸餾技巧,這有幾點好處,一則能避免智慧財產權爭議,二來能力極限不會受制第三方模型的上限。而從原始資料開始訓練,主要是想確保資料品質、可追溯,提高模型的可解釋性。
    目前模型當在 Private Preview 階段,開放申請試用
  2. MAI-Code-1-Flash
    主打推理效率的 Agent 程式開發模型,專為 GitHub Copilot、VS Code 和 Microsoft 技術棧量身定制並深度整合,擁有 5B 活躍參數,性能可與 Haiku 媲美但價格便宜,輸入 1M 0.75 美元,輸出 5 美元。
  3. MAI-Image-2.5 及 MAI-Image-2.5-Flash
    支援文字轉影像和影像編輯,Arena 評測得分有超過 Nano Banana Pro。目前在 Azure Foundry 已可實測,小測效果還行,但圖片裡文字正確度不如 GPT-Image-2 或 Nano Banana 2。
  4. MAI Transcribe-1.5
    轉錄模型,準確率達到目前的頂尖水準(SOTA, State-Of-The-Art),速度比 Gemini 3.1, Scribe v2, GPT-4o-Transcribe 等同類模型快五倍,並且內建支援 43 種語言的領域特定術語。
  5. MAI-Voice-2 及 MAI-Voice-2-Flash
    支援 15 種語言高品質、自然語音生成,能根據短樣本進行語音自適應,並具備強大的防濫用保護機制。語音展示 MAI-Voice-2-Flash 則主打用更低的成本和更高效率實現接近 MAI-Voice-2 的品質。

除了現成模型,Microsoft Frontier Tuning 允許企業使用自訂數據訓練出自己的模型,讓效能與品質更符合企業特定需求。現在實例是針對 Excel 優化的 MAI 模型與 GPT 5.4 的性能相當,但效率提升了 10 倍。

此外,我一直以為微軟沒有研發自家 AI 晶片,但實際上是有的 - Maia 200,採用台積電 3 奈米製程,內建原生 FP4 與 FP8 Tensor 核心,配置 216GB HBM3e、7TB/s 記憶體頻寬與 272MB 晶片內 SRAM,整體設計明確鎖定低精度推論與高 Token 吞吐需求。其 FP4 運算效能約為第三代 AWS Trainium 3 倍,FP8 效能則高於 Google 第七代 TPU,在資料中心實際部署中效能成本比提升約 30%。

參訪完畢。


Comments

Be the first to post a comment

Post a comment