小紅書在 OSDI '26 發表 Helmsman,以聚類式索引、使用者空間儲存棧與 GPU 加速,用 40 台全快閃伺服器承載原先約 35,000 核與 0.35 PB DRAM 的近似最近鄰搜尋工作負載,硬體成本節省超過 90%。

從記憶體圖索引走向全快閃

小紅書(RedNote/Xiaohongshu)的搜尋、推薦與廣告服務高度依賴近似最近鄰搜尋(approximate nearest neighbor search, ANNS)。在嚴格的服務水準協議(SLA)下,過去必須仰賴記憶體內的圖形索引 HNSW 才能同時兼顧吞吐與低延遲。然而用戶與內容規模持續膨脹,記憶體佔用隨之失控,資本與營運成本成為瓶頸。該團隊在 OSDI ‘26 發表的論文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with Helmsman》指出,將 ANNS 從 HNSW 遷移到建構於全快閃(all-flash)伺服器之上的聚類式(clustering-based)架構,是兼顧成本與效能的可行走法。

三項關鍵設計

根據 USENIX 公開的論文摘要,Helmsman 結合三項核心元件:面向 ANNS 的使用者空間(userspace)儲存棧,藉以繞過核心 I/O 路徑、降低閃存讀取的額外開銷;分層學習式剪枝(leveling-learned pruning)模組,取代固定式剪枝策略以動態收斂搜尋空間;以及 GPU 加速的索引建構管線,讓十億級向量規模的索引重建可在數小時內完成。作者群來自小紅書、華東師範大學與上海交通大學,論文收錄於 OSDI ‘26 論文集第 1623 至 1639 頁。

對大規模檢索基礎設施的意義

真正值得決策者關注的數字在落地成果:論文明白寫道,目前上線部署已穩定運行數個月,40 台全快閃伺服器承載了過去需要約 35,000 個 CPU 核與 0.35 PB DRAM 才能支撐的 ANNS 工作負載,硬體成本節省超過 90%。這組對比說明:當向量檢索進入十億級規模,純記憶體方案的邊際成本將快速失控,把熱資料留在 DRAM、把檢索主路徑搬到閃存並以軟體補回延遲落差,已是經過生產驗證的路線。若要把這條成本曲線放進更大的 AI 需求背景,可對照 Alphabet 財報揭露的 Cloud 訂單與每分鐘 220 億 token 用量;前者聚焦檢索基建,後者呈現整體運算需求。對臺灣正在評估 RAG 與推薦系統基礎架構的團隊而言,Helmsman 提供的不是另一個 ANN 演算法,而是一份可參照的儲存─計算重構成本曲線。若需先釐清這類系統在 RAG 中的角色,可先看〈Embedding 與向量檢索〉的定義。