OpenAI 於 7 月 23 日將 ChatGPT Voice 推入桌面版,由 GPT-Live 驅動,可同時說話、聆聽並以語音控制電腦、協調 Codex 與 Work 中的多個智慧代理,macOS 與 Windows 付費方案全球推送。
語音進入桌面,且能同時做多件事
OpenAI 在 7 月 23 日透過官方 X 帳號宣布,ChatGPT Voice 正式登上桌面版應用程式。使用者可單憑語音控制電腦,並同時指揮在 ChatGPT Work 與 Codex 中運作的多個智慧代理(agents)。關鍵在於底層由 GPT-Live 驅動,讓助理能一邊說話、一邊聆聽、一邊協調應用內的工作,而不再受限於傳統語音助理「說一句、回一句」的逐輪往返。同日 Anthropic 也宣布 Claude 語音模式開放 Opus、Sonnet 並可呼叫 Gmail、Slack 等連接工具,兩家同日把語音助理賽道推進主力介面。
這項設計直接將 ChatGPT 從「問答工具」推向「同步操作介面」:使用者可在同一對話中分派多項任務,例如讓 Codex 撰寫程式、讓 Work 整理文件,過程中持續以語音補充指令。
誰能用、什麼時候能用
根據 OpenAI 公告,功能於當日全球推送,平台涵蓋 macOS 與 Windows,開放方案為 Plus、Pro、Business、Edu 與 Enterprise。免費方案未在首波名單內。
OpenAI 隨後在另一則貼文補充,使用者也可透過 iOS 應用配對遠端存取,在 Codex 中使用 ChatGPT Voice,Android 支援則預告「即將到來」。這顯示語音控制被定位為跨裝置的代理操作入口,而非單一桌面功能。同樣主打跨裝置接力的 百度搭子 則以共享記憶與桌面內嵌瀏覽器切入;兩者分別從語音入口與任務延續性處理工作流中斷。
對工作流的實際影響
對重度使用者而言,這次更新的意義不在模型能力本身,而在互動頻寬。當語音能同時驅動多個代理,等於把鍵盤與滑鼠的單線操作,擴張成可平行分派任務的聲控排程。程式開發、研究整理、文件協作等場景,最有機會率先受惠。
值得留意的反面是成本與可觀察性:當多個代理同時運作,token 消耗與任務除錯難度都會上升,使用者能否清楚掌握每個代理的進度與花費,將決定這種「聲控多代理」是生產力升級或新的失控點。OpenAI 此次並未公布定價計量細節,後續需追蹤實際用量與帳單表現。
短線上,企業導入應優先評估資料落地與權限邊界:語音指令觸發電腦控制與代理執行,涉及本機操作與資料讀取,部署前應釐清 Enterprise 方案的治理設定,避免代理越權存取敏感檔案。