技術報告上的新榜首:98.9 分怎麼來的
語音模型的跨廠榜單,這幾天傳出易主消息。一份名為《StepAudio 3 Realtime Technical Report》的技術報告近日登上 arXiv(編號 2609.14005),核心主張用一句話就能講完:StepAudio 3 Realtime 在 Artificial Analysis 的全雙工評測排名第一,總分 98.9。Artificial Analysis(AA)是獨立於各家模型廠的評測機構,其語音榜單今年起成為挑選語音模型的主要跨廠參照;被技術報告點名摘冠的 StepAudio 系列,隸屬上海 AI 公司階躍星辰(StepFun),該公司在 GitHub 的 stepfun-ai 組織下維護整個系列的程式碼、論文與權重。
《IT之家》的報導補上了產品面的輪廓:這次發布的 StepAudio 3 系列包含 Realtime、ASR、TTS、Gen 與 Music 五款模型,已在階躍星辰開放平台上線;報導並稱,在 AA 的 Conversational Dynamics 項目上,StepAudio 3 Realtime 以 98.9% 的綜合得分排名全球第一,與技術報告的數字相互印證。五款模型各自的官方模型卡與平台定價文件,目前還無法逐一核對,但技術報告與媒體報導兩條線指向同一件事:即時語音互動這一環,競爭又往前推了一格。
AA 全雙工評測在量什麼
要看懂 98.9 的分量,得先知道 AA 在量什麼。「全雙工」指模型可以同時聽與說:使用者說到一半可以插話,模型一邊播放語音、一邊持續接收對方的聲音,並即時決定接話、等待或收尾。這與早期「你說完、我想、我再答」的輪流制語音助理是兩種產品形態,考驗的不只是答題正確率,更是對話節奏——什麼時候該回應、什麼時候該沉默、被搶話時如何收場。《IT之家》對 StepAudio 3 Realtime 的描述正是這個方向:能像真實交談的人一樣判斷對話節奏,並處理臨時打斷與連續回饋。
AA 的語音對語音榜單頁把這些能力攤成可比較的欄位:語音推理(採 Big Bench Audio 子集)、對話動態、代理表現、競技場偏好(Elo)、任務成功率,再加上首音延遲(秒)與每小時音訊輸入成本(美元)兩個營運數字。這次被技術報告引述的全雙工評測,媒體報導將它對應到對話動態這一側,也就是「聊得自然、接得住話、打斷不失態」的那部分分數。關於這套指數的欄位設計與計分邏輯,AA 發布 Speech to Speech Index 的報導有完整拆解。

從開源框架到 StepAudio 3:StepFun 的語音路線
StepAudio 3 並不是憑空出現的黑馬,而是一條走了近一年的開源路線的最新一站。2025 年 11 月,StepFun-Audio 團隊在 arXiv 發表 Step-Audio-R1 技術報告(arXiv:2511.15848),主張 R1 是第一個成功在音訊領域解鎖推理能力的音訊推理模型。報告提出「模態接地推理蒸餾」(Modality-Grounded Reasoning Distillation)框架,讓模型生成真正錨定在聲學特徵上的推理鏈,而不是與聽到的內容脫節的自言自語;在橫跨語音、環境音與音樂的理解與推理評測上,R1 超越 Gemini 2.5 Pro,並與當時最先進的 Gemini 3 Pro 相當——對標對象從一開始就設在 Google。
系列的後續節奏相當緊湊。官方 GitHub 儲存庫的更新紀錄顯示,團隊在 2026 年 4 月 29 日發布 Step-Audio-R1.5 的技術報告,README 同時把 R1.1(Realtime)定位為 R1 的重要升級,設計目的放在即時互動的口語對話。整個系列採開源策略:儲存庫以 Apache-2.0 授權,附上 R1 與 R1.5 的論文 PDF、基準測試資料與 vLLM 部署範例,R1.1 的權重則放在 Hugging Face 模型卡供直接下載。換句話說,StepAudio 3 Realtime 這次的 98.9 分,是站在已公開兩代論文與可下載權重的基礎上拿到的,不是封閉黑箱裡的單一數字。

榜單外的牌局:語音模型的 2026 競爭
把鏡頭拉遠,這則消息是 2026 年語音模型競爭的縮影。合成端,阿里巴巴的 Qwen-Audio-3.0-TTS 今年曾以 Elo 1234 登上 AA Speech Arena 盲測首位,當時榜上對手就包括 StepFun 自家的 StepAudio 2.5。對話端,OpenAI 的 GPT-Live 走全雙工互動層加後端委派的路線,API 上線與計價先前已見諸報導;NVIDIA 則開源了支援工具呼叫的全雙工模型。「能不能同時聽與說、能不能接住節奏」已從差異化功能變成入場券,AA 的語音指數正是為這個戰場畫出的計分板。
StepAudio 3 Realtime 的特殊之處在於奪冠者的身分:一家以開源著稱、直接對標 Gemini 的中國公司。R1 論文當時就寫明超越 Gemini 2.5 Pro、逼近 Gemini 3 Pro,顯示這條路線的目標從一開始就是全球榜單,而非區域市場。對開發者而言,這代表即時語音互動的候選清單正在變長,而且其中一部分可以直接下載權重自架,不必綁在單一雲端服務上。
對開發者的實際影響
具體影響可以分成三層。第一,選型清單多一個候選:AA 榜單把品質分項、首音延遲與每小時成本放在同一列,開發者可以按場景畫權重——電話客服先看首音延遲與成本,使用者等不了太久,帳單又隨通話時長線性成長;陪伴與會議型應用先看對話動態與競技場偏好,聊得自然比答得快重要;辦事型代理先看任務成功率與代理表現,查得到、訂得到、改得動才是真本事。第二,自建路徑持續成熟:Apache-2.0 授權加 vLLM 部署範例,讓自建全雙工語音代理不必從零造輪子;對語料不能出境的場景(醫療、金融客服),這條路的吸引力只會上升。第三,評測要自己動手:98.9 指向的是即時對話互動這一環,不代表 ASR、TTS 或音樂生成同步領先——系列拆成五款模型正是因為各司其職,導入前應回到各分項成績與官方文件逐一確認。
冷讀 98.9:還有哪些要等驗證
最後把該潑的冷水潑清楚。第一,98.9 出自廠商技術報告對 AA 評測的引述,AA 頁面的即時分數與名次會隨模型版本與配置變動,引用時應連同查閱日期一起記錄。第二,五款模型家族、平台定價與可用地區,目前主要依賴媒體報導;第一方的模型卡與平台文件尚未齊備,R1.1(Realtime)與 StepAudio 3 Realtime 之間的版本對應關係,公開文件也還沒有說清楚。第三,AA 榜單沒有針對繁體中文的語音表現單獨給分,中文客服或語音助理場景的實際輪替、打斷與口音處理,仍需以自有語料實測。值得追蹤的後續指標有三個:StepAudio 3 其餘四款模型的官方文件何時補齊、AA 頁面上 StepAudio 3 條目的分項成績長什麼樣,以及這個榜首在下一波模型更新後能坐多久。





