Microsoft 以 hill-climbing 機制把自研 MAI 模型塞進 GitHub Copilot 與 Excel,MAI-Code-1-Flash 在 Copilot 以約一成優勢超越 GPT 5.4 Mini 與 Claude Haiku 4.5,Excel 內部模型在常見任務追平 GPT-5.6,且 token 更少、成本更低。

hill-climbing 把前沿能力搬進自家產品

Microsoft Superintelligence 團隊公開 hill-climbing 機制的首批產品案例:MAI 模型在 GitHub Copilot 與 Excel 內部完成產品化訓練,目標不是衝單一基準,而是在真實任務上把「品質-成本」曲線持續往上爬。CEO Satya Nadella 在 X 上的說法更直白:來自 OpenAIAnthropic 的前沿模型、MAI 模型、編排框架、記憶與工具,共同組成一套可替換的爬山系統,重點是即便抽換掉某個模型,評估指標仍能繼續爬山。

關鍵設計是把編排框架、記憶、上下文、技能外化於模型之外,並在產品內的 reinforcement learning environment(RLE)中訓練模型,讓它針對使用者真正在乎的任務獲得獎勵。

GitHub Copilot 與 Excel 的實測數字

MAI-Code-1-Flash 自 6 月 Build 大會後部署進 GitHub Copilot,已被「數百萬開發者」日常使用,Microsoft 給出的對比基線是 GPT 5.4 Mini 與 Claude Haiku 4.5:

  • 在 VS Code 的 code accept rate 高出約 10%。
  • 開發者多日回訪的比例較 GPT 5.4 Mini 高 6%、較 Claude Haiku 4.5 高 11%。
  • 中位數 token 用量降低約 10%,且使用者主動發起的 turn 更多。

Excel 則驗證了「從程式碼遷移到知識工作」的可移植性:以 MAI-Code-1-Flash 為起點,在 Excel RL 環境中再訓練,得到的模型在常見任務上與 GPT-5.6 相當。由於模型更小、更有效率,能在 Nvidia H100 與 A100 級 GPU 上同時服務,不必綁定最新一代加速器,這對 Microsoft 的部署成本是直接降低。

對企業的模板意義

Microsoft 強調這套流程並非自用專利:相同的第一方產品堆疊——模型、harness、agent、產品特定評估——正是企業可在 Foundry 與 Frontier Tuning 上自行複製的模板,用自有評估體系、自有 RLE、工作流與上下文訓練出符合自身任務的專用模型。在 agent 層,Microsoft 也已把〈MagenticLite〉整套 agent 堆疊(含 MagenticBrain 編排與 Fara 電腦操作模型)開源到 Hugging Face,讓同一套產品堆疊可供外部研究與改作。

下一步將把 hill-climbing 延伸到 Copilot Chat、Outlook、PowerPoint 等更多產品。對決策者的訊號是:前沿能力的競爭正從「誰有最大的模型」轉向「誰能用產品內資料把中型模型爬到任務前沿」,而 Microsoft 正試圖把這條路徑包裝成可販售的平台服務。由於這些數字來自 Microsoft 自家產品環境,採購方仍應搭配外部任務評測;Tencent WorkBuddy Bench 的 Code、Web、Office、Security 四領域設計提供了可重跑的另一把尺。