從快但淺,到能跟上思路的參謀

Anthropic 在 7 月 23 日宣布,Claude 語音模式即日起可在 Claude Opus、Claude Sonnet 與 Claude Haiku 三個模型上運行。先前語音模式僅跑在 Haiku 上,官方選它是為了速度,但對於在長會話中以口語推演真實業務問題的使用者而言,回應快卻往往不夠深。現在 Opus 與 Sonnet 兩個主打難題求解的模型補上這塊缺口。同一天,OpenAI 也把ChatGPT 語音推入桌面版、並能以語音指揮多個智慧代理,兩家在同日把語音從附屬功能推向主力互動介面。

使用者可在對話中途以模型選擇器切換,語音模式會採用所選模型中最快的版本以維持流暢度;預設則沿用上次文字聊天使用的模型,避免在語音與文字之間切換時要重來。官方形容新版能讓使用者「說出半成形的想法、釐清自己真正的觀點」,Claude 會主動追問並在使用者的思考上延伸,而非直接給答案。

推理深度與即時回應的權衡

語音介面先天帶有延遲預算:從使用者說完話到模型開口回應,若超過約半秒就會破壞對話節奏,這正是先前語音模式只敢跑在 Haiku 上的根本原因。Opus 等級的深層推理往往需要數秒到數十秒的思考鏈,與即時性直接衝突。Anthropic 的折衷是串流生成——把首 token 延遲與整體生成時間拆開,讓模型邊想邊說,而「採用所選模型中最快的版本」一語,暗示在版本層級做投機式路由以壓低入口延遲。這代表語音從此不再是單一層級的介面,而是一種對模型敏感的媒介:使用者主動選 Opus,等於用等待換深度,把延遲從工程問題升級為產品定位的選項;也意味著同一句「嘿,Claude」,在不同模型下的回應節奏與可承擔任務複雜度,已經是兩種不同的產品。

從討論到執行:連接工具上場

語音模式這次還打通了連接工具(connectors)。使用者可請 Claude 把 Google Calendar 上的會議延後 30 分鐘、把客戶提案討論轉成 Canva 一頁文件,或彙整當日郵件並草擬回覆。Claude 在動用任何已連接工具前會先請求許可,連接工具可在行動版、桌面版與網頁版的「設定 > 連接器」中新增。

語音指令可分別呼叫 Gmail、Slack、Google Calendar 與 Canva 四種連接工具。
圖① 語音模式打通連接工具,可用語音呼叫 Gmail、Slack、Google Calendar 與 Canva。

語音場景下的授權難題

連接工具搬到語音介面,真正變難的不是技術而是授權流程。在文字介面裡,模型要動用工具時可以跳出一個確認框,使用者看清楚再點同意;但在語音對話中,使用者多半不在盯螢幕,模型只能用口語徵詢「我現在幫你把這封信寄出,好嗎?」。這意味著授權從視覺確認變成聽覺確認,任何一句含糊的回應都可能被誤判為同意,而一旦連接的是信箱、行事曆或協作平台,誤動作的代價是真實的——郵件發出、會議改期、文件被覆寫。Anthropic 選擇「動手前一律先請求許可」的保守設計,正是對這層風險的回應。

這也點出語音助理競爭的下一個焦點:當 Opus 等級的推理能力、連接工具的執行力、與語音的便利性三者疊加,產品定位已從「問答機」走向「能代為動手的代理」。誰能把授權模型做得既安全又不打斷對話節奏,誰就能把這條路走通;反之,一次誤動作的信任裂痕,可能比任何功能缺失都更難挽回。免費版限用一個連接工具、付費方案開放全部,這條分界本身就反映了廠商對風險與價值的定價。

連接信箱與行事曆前需取得明確授權,但語音同意比視覺勾選更容易產生歧義。
圖② 語音授權從視覺確認轉為聽覺徵詢,動手前一律先請求許可。

11 種語言但仍無中文,用戶的代價

語言支援擴及 11 種:英文、法文、德文、印度文、印尼文、義大利文、日文、韓文、巴西葡萄牙文、拉丁美洲西班牙文與西班牙西班牙文。對決策者而言關鍵在於:中文並未入列,且 Claude 不會自動偵測語言,必須口頭要求或手動從語音設定中切換,過去的文字語言設定也不會自動帶入語音模式。

本次更新已對所有聊天用戶開放 beta 測試,行動版體驗最佳。免費方案可用 Haiku、一個連接工具與全部支援語言;付費方案可存取更多模型與全部連接工具。語音對話計入常規使用額度——對想長時間用 Opus 推演的用戶,這才是真正要算的成本。