arXiv 論文提出 AREX,以內外雙循環做遞迴自改進(逐約束驗證再回頭補證),並開源 4B 密集與 122B-A10B MoE 兩個模型,在 BrowseComp、HLE 等深查基準上顯著超越同規模基線。

把「搜更久」換成「先驗證再補證」

深度研究的本質,是要找到一個能同時滿足多重約束的答案。論文作者群(含 BAAI、人民大學等機構的研究者)觀察到一個不對稱性:發現答案很貴,但驗證一個候選答案往往可拆成逐條約束的檢查,相對便宜。AREX 據此把方向從「拉長搜尋時間」轉向「遞迴自改進」(Recursively Self-Improving, RSI):內層循環收集證據、產生初步答案,外層循環逐條約束審計這個答案,挑出未解的宣稱,再啟動針對性的後續研究。

為了在長跨度任務中維持這套循環不退化,AREX 學習了一個自主上下文更新工具,把不斷膨脹的互動歷史壓縮成精簡的「改進狀態」,保留已驗證證據與未解約束,且不依賴外部大模型來做摘要。

4B 與 122B-A10B MoE 實例化並開源

訓練面,AREX 採用 agentic mid-training 與長跨度強化學習,並在合成的已驗證任務與高品質軌跡上訓練;為緩解長跨度下最終獎勵稀疏的問題,特別強調那些取得決定性證據或修正錯誤研究方向的關鍵步驟。團隊實例化兩個模型:4B 密集模型,以及 122B-A10B(總參 122B、每 token 激活約 10B)的 Mixture-of-Experts 模型,權重已在 HuggingFace 的 BAAI/arex collection 公開。

基準成績與對決策者的意義

在 BrowseComp、WideSearch、DeepSearchQA、Humanity’s Last Exam(HLE)以及多項推理與工具使用基準上,AREX 顯著優於可比規模的基線模型,並與使用明顯更多激活參數的模型保持競爭力。論文標題為《AREX: Towards a Recursively Self-Improving Agent for Deep Research》,已於 2026 年 7 月 23 日上傳 arXiv(編號 2607.21461)。

對AI 決策者而言,重點不在分數本身,而是「逐約束驗證 → 針對性補強」的迴圈設計,可作為評估自建檢索代理與企業研究助手時的工程藍圖;10B 量級激活的 MoE 在推理成本與品質間提供了明確的落點,是評比深查型代理時值得列入的基準。若把這套設計放到治理與採購語境,可對照〈北京智能體政策如何定義 Harness Engineering〉;若系統進入十億級檢索規模,〈Helmsman 的全快閃向量架構〉則提供另一層基礎設施成本參照。