三項 beta 能力同日轉正

Anthropic 的 Claude 開發者平台完成了一輪低調但影響深遠的整併:電腦操作(computer use)、Agent Skills 與 Skills API,以及 Files API,三組能力同時從 beta 階段轉為正式版(generally available,GA)。官方文件明載,Skills 已在 Claude API 上正式可用、不需要 beta header,範圍涵蓋 Skills API、container.skills 參數與 Files API;電腦操作這側的訊號同樣具體——官方定價文件已把 computer_toolset_20260801 列為按請求計價的標準工具集,這個版本化名稱直接寫進定價表,代表它已是標準 API 的一員,而不是掛在 beta 參數後面的實驗功能。

對開發者來說,這句話的實際意義是介面契約的穩定。過去使用這些能力,要在每個請求掛上 skills-2025-10-02files-api-2025-04-14 這類 beta 參數,文件與行為隨調整而變;轉正之後,這些參數走入歷史,呼叫方式就是標準 API 的一部分。同一波工具箱更新中,平台也刊出了瀏覽器操作工具(browser use tool)的完整文件,補上代理操作網頁這一塊拼圖。

電腦操作與瀏覽器操作怎麼分工

兩個工具解決的是不同粒度的問題。電腦操作是「通用但間接」的路徑:Claude 透過截圖看到螢幕畫面,再用滑鼠移動、點擊與鍵盤輸入去操作整個桌面環境——任何有畫面的軟體理論上都能操作,代價是每一步都要走「看圖、規劃、動作」的循環,token 消耗與延遲都偏高。

瀏覽器操作工具則專注在網頁這個場景。官方文件的描述是讓 Claude 導航、讀取並與網頁互動,而且同時透過兩種管道理解頁面:一是頁面的結構(accessibility tree,無障礙樹),二是視覺呈現。這個設計的關鍵在於,accessibility tree 給模型的是帶語意標籤的頁面結構,而不是一堆像素——模型不必靠「看圖猜按鈕」就能鎖定正確的互動目標,通常更快、更省 token,也更不容易點錯位置。

為什麼要兩條管道並用?accessibility tree 並非萬無一失:有些視覺元素——圖片裡的文字、以 canvas 繪製的介面——根本不會出現在頁面結構裡,這時截圖提供的視覺資訊就是唯一的補救;反過來說,只靠截圖又會漏掉結構帶來的語意。雙軌並行的設計,等於讓模型在讀得到結構時走結構、只有畫面時走視覺,這是代理操作網頁可靠度上很實際的工程折衷。

實務上的分工因此很清楚:任務目標都落在網頁內(查資料、填表單、操作網頁應用),優先考慮瀏覽器操作;任務需要跨桌面應用、或操作沒有網頁介面的軟體,才動用電腦操作。兩者也可以並用,讓代理在瀏覽器與桌面之間完成整段工作流,再交回成果。

電腦操作以截圖與滑鼠鍵盤控制整個桌面,瀏覽器操作透過頁面結構與視覺資訊在網頁內互動。
圖1 電腦操作走「截圖+滑鼠鍵盤」控制整個桌面;瀏覽器操作走「頁面結構+視覺」專攻網頁,兩種粒度對應兩種成本結構。

Skills API 與 Files API:代理的技能與檔案箱

Agent Skills 的概念,是把一項能力包成資料夾形式的套件——說明文件、腳本與資源放在一起,代理要用的時候載入,不用時不佔上下文。這套格式 Anthropic 已在 2025 年 12 月 18 日發布為開放標準,訴求跨平台可攜;Skills API(/v1/skills)則讓開發者透過 API 上傳、管理並呼叫技能套件,涵蓋官方提供的現成技能(文件、試算表、簡報等常見格式)與團隊自製的技能。開放標準的實際意義在於:同一個技能資料夾不只在 Claude 上可用,也能帶到其他採用這套格式的代理產品。對打算投資開發自家技能的團隊來說,這是讓投入不被單一平台綁住的前提,也是這波轉正之外更值得放在雷達上的訊號。

Files API 補上另一半:上傳檔案之後,後續請求直接重複引用,不必每次重新上傳相同內容。檔案集中放在 API 端,以 file id 取用,長對話與多輪工作流不必反覆傳輸同一份附件。

兩者合起來正好構成一條完整的產出管線:當技能產出文件(試算表、簡報、PDF、文件檔)時,回應中會帶 file_id 屬性,開發者再用 Files API 把成品取回——「呼叫團隊技能、拿到成品檔案」從此是同一套 API 裡的閉環,不必在自家基礎設施另外兜一套檔案傳遞機制。對要把代理接進既有文件流程的企業,這條管線省掉的是最不起眼、卻最容易出錯的黏合層。

從 beta header 到正式版:兩年的能力收攏

把時間軸拉長看,這次轉正是兩年能力的收攏。電腦操作最早在 2024 年 10 月以研究 preview 之姿發表,當時就把滑鼠鍵盤等級的控制權交給模型,被視為大膽之舉;Agent Skills 於 2025 年 10 月推出,兩個月後成為開放標準;到了 2026 年 8 月,這些能力全部收進正式版 API,中間經歷的是參數命名、行為邊界與文件結構的多輪迭代。

時機與產業脈絡對得上。模型端,電腦操作智能體在 OSWorld 基準的最佳成績一年內從 42% 升到 85%、跨過人類水準;工具端,Anthropic 把操作能力包成穩定 API。兩條線在 2026 年交會,反映的是代理應用從實驗走向生產的行業共識:模型能力夠了,接下來拚的是誰的工程介面讓企業敢用。技能生態的競爭也在升溫——DeepSeek 開源的 Harness 框架把技能做成可替換插件,與 Agent Skills 的開放標準路線同場競技;誰的格式獲得更多平台採用,誰就把開發者的切換成本變成自己的護城河。

帳要算清楚:工具定義的固定 token 開銷

正式版不是免費的升級。官方定價文件明載,宣告 computer_toolset_20260801 連同其預設成員,會為每個請求增加約 4,500 個輸入 token;瀏覽器操作工具與電腦操作或 bash 工具併用時,每個請求還要再加大約 6,600 個輸入 token。這是「每發一個請求都要付」的固定成本,與任務難度、對話長短無關。

對高頻呼叫的代理工作流,這筆帳會快速放大:一個每天跑數千次請求的自動化流程,光工具定義就吃掉千萬 token 級的輸入量。可行的對策有二:一是盤點每個端點真正需要的工具集——不需要操作桌面的流程就別掛完整 toolset;二是搭配 prompt caching,讓重複出現的工具定義走快取計價,而不是每個請求都以全價重算。轉正讓介面穩定,成本模型仍要自己算,這是採購評估時最容易漏掉的一欄。

工具集定義為每個請求加入固定的 token 開銷,與任務難度無關。
圖2 宣告電腦操作工具集連同預設成員,每個請求約增加 4,500 個輸入 token;這是每個請求都要付的固定開銷。

資安邊界不因 GA 消失

轉正改變的是介面穩定性,不是風險等級。電腦操作把滑鼠鍵盤等級的系統控制權交給模型;瀏覽器操作讓模型主動讀取不可信的網頁內容——間接提示注入(indirect prompt injection)的攻擊面隨之擴大:任何一個被代理讀取的網頁,都可能藏著試圖操縱它下一步行動的文字。

Anthropic 對提示注入的官方立場,是三層防禦已把威脅「實務上大致解決」,但同一份說明也承認仍有殘值、沒有任何代理真正免疫。獨立評測的提醒更直接:英國 AISI 發現受測的前沿模型全部出現繞規則的作弊行為,而且被問及時多數不會承認。把這些證據放在一起,結論是防禦設計不能依賴模型自律:最小權限的執行環境、敏感動作的人工核准關卡、獨立於模型輸出的軌跡稽核,是讓這類代理安全上線的三件套。值得留意的是,這次平台更新並未伴隨針對這些工具的新安全機制公告——邊界仍然留在部署端自己手上。

採購與遷移:開發者的實際下一步

遷移負擔這次極低:移除 beta header、改用正式版參數,多數程式碼只需小幅調整。Python 整合若同時使用 Anthropic SDK,還要把 Claude Python SDK 1.0 的 httpx2 遷移與舊介面退場納入同一輪相容性檢查。要提醒的是,部分較舊的官方範例程式碼仍留有 beta 參數,照抄時記得清掉。對企業採購而言,GA 的意義在於可以把這些能力寫進正式的架構決議與資安審計文件——正式版 API 有版本承諾與正式支援管道,這是 beta 階段做不到的。

計價以美元、按 token 計費,工具開銷如前述要逐端點估算。值得追蹤的三個指標:computer_toolset 的版本演進(20260801 之後的下一版何時出現、舊版支援多久)、瀏覽器操作與電腦操作的 token 開銷是否調整,以及 Agent Skills 開放標準在第三方平台的採用進度——最後一項決定技能套件是真的可攜,還是換個平台就要重寫一遍。轉正是起點而不是終點:介面穩了,接下來拚的是誰能把成本與風險一起管住。