Anthropic 於 7 月 24 日發布 Claude Opus 5,以與前代 Opus 4.8 相同的每百萬輸入 5 美元、輸出 25 美元,提供接近 Fable 5 的前沿智能,並成為 Claude Max 預設與 Claude Pro 最強模型。

效能與性價比

Anthropic 於 7 月 24 日發布 Claude Opus 5,鎖定日常高頻使用情境。官方定位為「接近 Claude Fable 5 前沿智能、但價格僅一半」的模型,定價維持與前代 Opus 4.8 相同:每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。

在軟體工程任務上,Frontier-Bench v0.1 中 Opus 5 的效能超過 Opus 4.8 兩倍以上,且單任務成本更低;CursorBench 3.2 於最大努力設定下,與 Fable 5 巔峰分數差距不到 0.5%,但成本僅一半。知識工作評測同步拉開差距——ARC-AGI 3 得分為次優模型的三倍,Zapier AutomationBench 通過率約為次優的 1.5 倍,OSWorld 2.0 則以略高於 Fable 5 三分之一的成本超越其最佳結果。

自我驗證與代理能力

Anthropic 強調 Opus 5 在「驗證自身工作、反覆收斂到成功」上的進步。官方舉例,在一項 Frontier-Bench 任務中,模型在無法直接檢視圖面的限制下,自行撰寫電腦視覺管線從原始像素萃取幾何,重建出 3D FreeCAD 機械零件;同設定的競品模型在五次嘗試內皆未完成。早期客戶如 Cursor、Devin 母公司 Cognition、Zapier、Box 回報其在長鏈代理、金融建模與法律工作流程表現穩定,Box 內部評測數據分析較 Opus 4.8 提升 11%、盡職調查提升 17%。

科學研究方面,Opus 5 在生命科學評測全面優於 Opus 4.8,有機化學任務(如從光譜資料推斷分子結構)內部基準高 10.2 個百分點,蛋白質序列影響預測高 7.7 個百分點。

安全與防護

Opus 5 未在風險性雙用途能力上推進前沿。在與私部門及政府夥伴共同進行的評測中,生物研究與攻擊性網路安全仍落後 Mythos 5。Anthropic 內部 OSS-Fuzz 評測顯示,Opus 5 在「發現」漏洞上接近 Mythos 5,但在「開發攻擊程式」上明顯落後。

模型行為稽核給出 Opus 5 整體偏差行為分數 2.3,為近期模型最低,Anthropic 稱其為迄今最遵循 Claude’s Constitution 的模型。資安防護上,Opus 5 的網路分類器較 Fable 5 干預頻率約減少 85%,允許在原始碼中尋找漏洞,但阻擋二進位掃描、滲透測試與攻擊程式生成;Claude.ai、Claude Code 與 Claude Cowork 中被標記的請求預設回退至 Opus 4.8。

取得方式與定價

Claude Opus 5 即日起於全平台供應,並成為 Claude Max 的預設模型與 Claude Pro 上最強模型。API 開發者可透過 claude-opus-5 串接;Fast 模式以約 2.5 倍預設速度運行,價格為基礎價的兩倍。同步釋出的測試版功能包含對話中段工具變更(不失效 prompt cache)與 API 自動回退機制,標記請求可自動路由至其他模型而非直接阻擋。

完整的價格比較、升級建議與跨模型對決,可參考〈Claude Opus 5 深度評測與成本分析〉,以及〈Claude Opus 5 vs GPT-5.6 Sol 比較〉。