Alibaba 通義千問推出 Qwen-Audio-3.0-TTS(Flash 與 Plus 雙版本),支援內聯情感標籤與自然語言風格控制,在 Artificial Analysis Speech Arena 以 Elo 1234 躍居排行榜第一。
雙版本與控制能力
Alibaba 通義千問於 7 月 23 日發布 Qwen-Audio-3.0-TTS,鎖定即時互動與高品質生成兩條產品線。Alibaba Cloud 官方文件顯示,模型分為 qwen-audio-3.0-tts-flash 與 qwen-audio-3.0-tts-plus 兩個版本,並支援系統語音與聲音複製。Flash 著重低延遲串流,適合對話與客服場景;Plus 主攻品質,可用於有聲內容與品牌配音。
控制能力是這一代的重點。官方文件列出情感與豐富語言標籤(如 [excited]、[sad]、[laughing]、[gasp]、[crying]),同時提供自然語言指令控制,可調整語氣、速度、情緒與音色。官方公告另稱支援 16 種語言、單次可生成最長 3 分鐘語音,並能在參考音訊含背景噪音時仍輸出乾淨語音;這幾項規格來自官方發布,未見獨立第三方逐項複核。
排行榜與定價
在 Artificial Analysis Speech Arena 盲測排行榜上,Qwen-Audio-3.0-TTS-Plus 以 Elo 1234 排名第一,緊追在後的是 SpeechifyAI Simba 3.2(Elo 1230)與 Google Gemini 3.1 Flash TTS(Elo 1215)。榜上對手還包括 Cartesia Sonic 3.5、StepFun StepAudio 2.5、ElevenLabs Eleven v3 與 MiniMax Speech 2.8 HD。
價格面更具張力。排行榜資料顯示 Qwen-Audio-3.0-TTS-Plus 計價為每百萬字元 27.6 美元,比第二名的 Simba 3.2(10 美元)高出近兩倍,也比 Gemini 3.1 Flash TTS(18.3 美元)貴。換言之,Alibaba 是以「品質溢價」而非低價搶市占,決策者選用前需衡量聽感差距是否值得這段價差。
對決策者的意義
對評估語音助手、客服自動化或內容本地化的團隊,Qwen-Audio-3.0-TTS 的吸引力在於「情感可控」這項能力——可直接在文字內嵌入標籤,或用自然語句調整情緒,降低對後處理工程的依賴。但需留意兩個限制:一是排行榜分數來自各廠商原生語音的盲測,實際部署音色未必相同;二是中文方言與繁體中文的具體支援範圍,官方文件未單獨列出,建議先以自有語料實測 Flash 版本再決定是否採用 Plus。
若要把配音模型放進可重複的影音生產線,可續讀 Runway Agent Workflows 的自然語言節點式流程;模型品質與流程可控性是兩個不同的選型層次。