雙版本與控制能力
Alibaba 通義千問於 7 月 23 日發布 Qwen-Audio-3.0-TTS,鎖定即時互動與高品質生成兩條產品線。Alibaba Cloud 官方文件顯示,模型分為 qwen-audio-3.0-tts-flash 與 qwen-audio-3.0-tts-plus 兩個版本,並支援系統語音與聲音複製。Flash 著重低延遲串流,適合對話與客服場景;Plus 主攻品質,可用於有聲內容與品牌配音。
控制能力是這一代的重點。官方文件列出情感與豐富語言標籤(如 [excited]、[sad]、[laughing]、[gasp]、[crying]),同時提供自然語言指令控制,可調整語氣、速度、情緒與音色。官方公告另稱支援 16 種語言、單次可生成最長 3 分鐘語音,並能在參考音訊含背景噪音時仍輸出乾淨語音;這幾項規格來自官方發布,未見獨立第三方逐項複核。
情感標籤的意義:TTS 從念對字走向演對戲
傳統 TTS 的核心指標是「把字念對、念自然」,評估的是音色擬真度與韻律流暢度。Qwen-Audio-3.0-TTS 把 [excited]、[sad]、[laughing]、[gasp]、[crying] 這類內聯標籤做成一等公民,加上自然語言指令調整語氣、速度與情緒,標誌的是這條賽道的目標函數正在轉移——從念對字走向演對戲。這對有聲書、遊戲配音、品牌廣告等需要情緒層次的場景,是把 TTS 從背景旁白層級推進到表演層級的關鍵能力。

代價在於可控性與一致性的平衡。情感標籤越豐富,模型在不同上下文中穩定重現同一情緒的難度越高;一個 [laughing] 在客服場景可能顯得突兀,在播客場景卻恰到好處。這也是排行榜分數(來自各廠商原生語音的盲測)與實際部署音色之間往往存在落差的原因——廠商調校過的展示語音,不等於團隊用自己的腳本與音色複製時的表現。決策者選用前,應以自有語料實測標籤的穩定度,而非只看 Elo 分數。
排行榜與定價
在 Artificial Analysis Speech Arena 盲測排行榜上,Qwen-Audio-3.0-TTS-Plus 以 Elo 1234 排名第一,緊追在後的是 SpeechifyAI Simba 3.2(Elo 1230)與 Google Gemini 3.1 Flash TTS(Elo 1215)。榜上對手還包括 Cartesia Sonic 3.5、StepFun StepAudio 2.5、ElevenLabs Eleven v3 與 MiniMax Speech 2.8 HD。
價格面更具張力。排行榜資料顯示 Qwen-Audio-3.0-TTS-Plus 計價為每百萬字元 27.6 美元,比第二名的 Simba 3.2(10 美元)高出近兩倍,也比 Gemini 3.1 Flash TTS(18.3 美元)貴。換言之,Alibaba 是以「品質溢價」而非低價搶市占,決策者選用前需衡量聽感差距是否值得這段價差。
排行榜之外的競爭格局:語音賽道的擁擠
Speech Arena 榜單本身揭示了語音賽道的擁擠程度。前十名同時聚集了新創(Cartesia、ElevenLabs、SpeechifyAI、MiniMax、StepFun)與大廠(Google、Alibaba),且分數差距極小——第一名的 Qwen-Plus(Elo 1234)與第二名的 Simba 3.2(Elo 1230)只差四分。在分數如此貼近的情況下,Elo 排名更像是統計波動範圍內的並列,而非清晰的品質排序。若要理解如何避免只讀單一榜單,可參考 LatentRank 用 Bradley-Terry 聚合多張排行榜的做法;它解決的是跨榜共識,不會取代語音場景的自有語料實測。

這對採購的實際意義是:語音模型已進入「品質趨同、差異在價格與控制」的階段。Qwen-Plus 每百萬字元 27.6 美元,是 Simba 3.2(10 美元)的近三倍、Gemini 3.1 Flash TTS(18.3 美元)的一倍半;當頂尖品質差距落在統計誤差內,溢價是否值得,取決於情感標籤與聲音複製這類差異化能力對具體場景的價值,而非排行榜名次。對延遲敏感的對話與客服場景,Flash 版本搭配更低單價,往往是比 Plus 更務實的起點。
對決策者的意義
對評估語音助手、客服自動化或內容本地化的團隊,Qwen-Audio-3.0-TTS 的吸引力在於「情感可控」這項能力——可直接在文字內嵌入標籤,或用自然語句調整情緒,降低對後處理工程的依賴。但需留意兩個限制:一是排行榜分數來自各廠商原生語音的盲測,實際部署音色未必相同;二是中文方言與繁體中文的具體支援範圍,官方文件未單獨列出,建議先以自有語料實測 Flash 版本再決定是否採用 Plus。
若要把配音模型放進可重複的影音生產線,可續讀 Runway Agent Workflows 的自然語言節點式流程;若需求改成可打斷、能同時聽與說的即時代理,則應另看 NVIDIA VoiceChat 11B 的全雙工與工具呼叫設計。模型品質、互動架構與流程可控性是三個不同的選型層次。





