一次 API 呼叫,建立可連跑多日的雲端代理

OpenAI 在 9 月 10 日發表 Agents API 公開測試版,把驅動 Codex 的代理執行框架(Harness)與沙盒基礎設施,第一次以正式 API 服務的形式開放給所有開發者。官方公告寫得明白:開發者只要在單次 API 呼叫中指定任務、模型、工具與執行環境,就能建立一個可直接投入生產的雲端代理。

值得注意的是,這次的主角不是新模型。OpenAI 在公告中回顧,把 Codex 與 ChatGPT for Work 擴展到全球數百萬人使用的過程中,學到的核心經驗是:好用的代理需要一套會管理上下文、有效率使用工具、能協調子代理的 Harness,也需要能讓代理可靠連跑多日的基礎設施——代理要有檔案可操作、有程式可執行、有地方保存中間結果。Agents API 交付的是這整套組合,而不是又一個模型端點。

這對「自組代理」的團隊是明顯的分界。過去要在雲端跑長時間代理,工程上得自行拼裝對話狀態管理、工具呼叫、沙盒隔離與錯誤恢復;現在這一層改由 OpenAI 託管,開發者把力氣放在定義任務、模型與工具的組合。

Harness 是什麼:模型之外的代理外骨骼

大型模型本質上是逐輪運轉的推理機器:收到輸入、產生輸出。要讓它變成能連續完成工作的代理,中間需要一層執行框架——也就是這幾個月迅速成為業界關鍵詞的 Harness。它負責在多輪之間維持與整理上下文、決定何時呼叫哪個工具、把大任務拆給子代理再彙整結果,並在沙盒裡實際執行程式碼。官方開發者文件給出的定位一句話講完:Agents API 就是跑 Codex 的那套 Harness,加上代管的底層代理基礎設施,讓開發者專心定義代理要做什麼,並內建自動上下文管理。

同一套邏輯的開源版本其實已經存在。GitHub 上的 openai/codex 儲存庫以 Apache-2.0 授權公開,自我描述是「在本地電腦上執行的 OpenAI 編碼代理」。換句話說,Agents API 並非憑空打造的新框架,而是把這套已在 Codex 產品線上驗證過的引擎,補上託管沙盒與長時間工作階段管理,包裝成一項服務。

模型核心外層包著執行框架,負責上下文管理、工具呼叫與子代理協調。
圖1 代理的執行框架包在模型外層,處理上下文、工具與子代理;模型本身只負責推理。

三種執行環境:託管沙盒、自架與合作夥伴

Harness 由 OpenAI 託管維護,但代理的運算環境由開發者選擇。公告列出的選項有三:OpenAI 託管的沙盒、開發者自己的基礎設施,以及合作夥伴提供的環境。這個設計對合規敏感的場景至關重要——受監管的資料可以選擇留在自家環境裡執行,而代理邏輯仍然用同一套 Harness。

公告的範例程式碼勾勒出 API 的形狀:開發者呼叫 beta.agents.sessions.create 建立工作階段,指定 gpt-6-astra 作為模型、掛上一個以 HTTP 傳輸的 MCP 觀測工具、開啟 multi_agent 並把並行子代理上限設為 3,再以 vault_ids 指定機密保管庫、以 environment 選擇 openai_hosted 並掛上能力目錄。最後一段輸入文字描述任務:調查某服務過去三十分鐘升高的 5xx 錯誤率,把部署、錯誤與依賴分析分派給子代理,並把證據與建議寫進輸出目錄。一個呼叫,工作階段就建立完成。

同一套代理引擎可選三種執行環境:託管沙盒、自家基礎設施與合作夥伴環境。
圖2 同一套 Harness 引擎有三種落地方式,資料要在哪個環境裡執行,由開發者決定。

長時間工作、子代理與計費方式

公告的章節標題本身就是功能清單:讓代理跨長工作階段持續運作、讓代理更有效率地使用更多工具、讓代理用子代理平行展開工作。對應到實務,就是代理可以在沙盒裡執行延續多日的任務、把不同面向的分析分派給並行子代理、透過 MCP 協定接上外部工具,並把中間產出與結論存回檔案系統。

官方文件也為沙盒劃出明確的適用時機:當代理需要操作檔案、執行命令、掛載資料室、產出成品、對外提供服務,或稍後回來延續有狀態的工作時,就該開沙盒。自架環境的定義同樣寬鬆——文件點名自己的筆電或受信任的運算資源都能接入,環境選擇遠比「一臺雲端伺服器」更有彈性。

計費是這次發布最實際的訊息:使用 Agents API 不加收額外費用,開發者只為代理消耗的 Token 與使用的工具付費,費率依官方定價頁計算。這代表成本結構完全由任務量驅動——長時間、多子代理的工作會直接反映在帳單上,成本治理也要從「每次請求多少錢」升級成「每個任務多少錢」:任務拆法、子代理數量與工具選擇,第一次同時是工程決策與成本決策。

從開源 Codex 到託管平台的產業脈絡

把視野拉遠,harness 已經從各家閉門的內部工程,變成公開的競爭介面。OpenAI 這一步的完整樣貌是兩段式:先把 Codex 的核心以 Apache-2.0 授權開源,讓任何人都能審視與自建;再把同一套引擎做成託管 API 對外收費。DeepSeek 走過類似的路——開源 MIT 授權的 Harness 智能體框架,把模型、工具、技能與沙盒全部插件化。OpenAI 的差異化在於它同時握有終端產品的規模驗證:Codex 與 ChatGPT for Work 的數百萬用戶,就是這套 Harness 的實績清單。

對開發者而言,開源與託管並存的意義是雙面的:開源版本提供了不被鎖定的退出選項,託管版本則免除了自建與維運的成本。兩者共用同一套核心邏輯,代表從託管服務遷回自建的路徑理論上是通的——在評估供應商鎖定風險時,這是少見的利多結構。

對開發者與企業的實際影響

最直接的受惠者,是想做代理產品、但不想為此養一個平台團隊的開發者。過去自組這一層要處理沙盒隔離、機密注入、子代理編排與中斷恢復;現在這些變成 API 參數。官方文件的快速入門也把門檻壓到最低:第一個練習,就是在 OpenAI 託管沙盒裡建立一個會撰寫並執行腳本的代理。

企業採購面的重點則在環境選擇與治理設計。資料不能離開自有環境的單位,可以直接選自架環境;而要在生產流程裡啟用多子代理平行作業之前,值得先參考 Anthropic 前沿紅隊的多智能體實測——多代理協同帶來的產能,與代理之間彼此干擾、甚至出現非預期行為的風險,是同一枚硬幣的兩面。務實的導入順序是:先用小範圍、可回報的任務驗證 Harness 的行為邊界,再逐步放大並行子代理的數量與工作階段長度,同時把每個任務的 Token 消耗納入監控。

公開測試版的限制與追蹤指標

公開測試版意味著 API 介面仍可能變動,正式依賴前應預留調整空間。官方文件特別提醒:Agents API 的工作階段、SDK 的工作階段、Responses 的對話與沙盒是四種不同的資源,各自的狀態與清理指示都要遵守——這不只是工程整潔問題,沒有正確清理的沙盒與工作階段,會同時累積成本與擴大資安暴露面。

長跑代理的經濟與安全模型也還年輕。按 Token 與工具計費,代表任務失控時帳單同步失控,需要為單一任務設上限與警報;計費細節攤開看更清楚——官方定價頁把各項工具逐一標價,例如網頁搜尋工具按每千次呼叫計費、搜尋內容的 Token 另依模型費率計算,代理跑得愈久、掛的工具愈多,帳單就愈像一張工程決策的鏡子。代理在沙盒裡擁有檔案與執行權限,環境選擇本質上就是信任邊界的選擇。值得追蹤的後續指標有三:何時脫離 beta、企業級控制項(用量限額、審計紀錄、資料駐留選項)何時補齊,以及開源 codex 儲存庫與託管 API 之間的功能差距會收斂還是擴大——最後這項,決定「不被鎖定」的承諾有多少兌現空間。