InMind 基準以 125 項專家驗證任務測試智能體記憶系統處理隱式關聯的能力;當關鍵記憶直接放入上下文,骨幹模型能答 84.0% 的間接查詢,但透過六種記憶系統檢索時最高僅 14.4%,失敗根源在查詢驅動的檢索介面,把「路由」確立為核心開放問題。
84% 與 14.4% 之間的斷層
InMind 是一個針對智能體長期記憶系統的基準,涵蓋 125 項經專家驗證的任務、橫跨十個生活領域,其中 113 項建立在可引用的公開來源上。它要回答的問題相當尖銳:當模型其實「記得」某件事,為什麼在需要時拿不出來?
論文用一組配對控制實驗給出令人不安的數字。同一份決定性記憶,若直接放進上下文,骨幹模型能回答 84.0% 的間接查詢;但同一份記憶一旦改由記憶系統在查詢到來時檢索,六種向量、圖與智能體記憶系統的最高命中率只剩 14.4%。落差不是出在模型會不會推理,而是出在記憶能不能在對的時刻被送進視線。
隱式關聯盲點:檢索器賴以運作的根本假設失效
這個落差要回到記憶系統運作的前提來解釋。多數檢索介面預設一個直覺:會被調用的記憶,和觸發它的查詢長得像,因此用相似度就能把對的記憶撈出來。一旦牽涉跨領域的常識,這個前提就站不住。論文舉的例子相當直接:使用者對堅果過敏這項事實,理應改變模型回應一份馬卡龍食譜請求的方式——馬卡龍以杏仁粉為主料——但「過敏」與「食譜」這兩段文字之間,不存在任何相似度能捕捉的線索,檢索器自然不會把它帶進來。論文把這類事實明明在、卻連不上的失敗,命名為隱式關聯盲點。
這也解釋了為什麼把檢索器從向量換成圖、再換成智能體,改善仍然有限:問題不在檢索的精度,而在查詢條件化這個介面本身。只要檢索仍由當下查詢驅動,面對那些需要跨領域常識才能串起的關聯,再強的檢索器都缺乏可用的匹配訊號。
三選一的控制實驗:不是沒記住,是沒被呈現
InMind 的方法論價值在於,它把過去評估裡混在一起的三種解釋硬生生拆開:事實從未被儲存、模型缺乏橋接知識、事實已儲存卻從未被呈現。多數基準只能告訴你答錯了,卻分不清是哪一個環節出問題。
實驗結果把責任明確指向第三種。同一批記憶系統在按需回憶相同事實時準確率高達 100%,代表事實確實存進去了、也取得出來;但在回答間接問題時,這些事實卻沒有在關鍵時刻被拉進上下文。換言之,記憶沒有漏存,模型也不缺常識,斷層發生在查詢到來、決定該呈現什麼的那一步。
放大嵌入維度為何救不了落差
直覺的修補方向是把嵌入維度加大,讓檢索器抓到更細的語意。論文確實測了:把嵌入維度提升八倍,各系統在答案盲測裡的目標召回率跟著上升,但 84% 與 14.4% 之間的差距基本紋風不動。
這個結果把瓶頸的位置釐清了:隱式關聯盲點不是嵌入不夠好的容量問題,因此也無法靠堆疊檢索工程來根治。一旦瓶頸被定位在介面而非表徵,投入更精細的向量空間就會撞上邊際報酬快速遞減的牆。
路由:決定哪些事實必須保持可見
論文用一個極簡的診斷探針驗證了這個定位:在查詢到來之前,就讓相關記憶保持可見,不必等檢索。結果這個動作就能恢復大部分的差距。這把問題從「如何更準地檢索」改寫成「如何決定哪些事實必須留在視線裡」,也就是路由。
對打造智能體的團隊而言,這代表資源的優先序該調整:與其無止境優化檢索器,不如把力氣放在路由策略上,決定哪些關聯必須常駐上下文。這恰好與 Anthropic 近期主張的〈上下文工程〉方向一致——把該可見的脈絡留在前緣、按需揭露細節,而非假設檢索永遠來得及;而在端側場景,〈Cactus 的置信度路由〉則示範了另一種在門檻處做取捨的路由決策,兩者都呼應同一個核心:與其讓所有資訊都進來,不如決定什麼該留下。