工具 / TOOLS新聞 / NEWS
SGLang Weight Cache Daemon:1T 權重載入縮至 0.63 秒
SGLang 發布 Weight Cache Daemon:量化權重常駐 GPU 守護行程,引擎重啟走 CUDA IPC 零拷貝,Ling-2.6-1T FP8 載入由 495 秒縮至 0.63 秒。
所有與「SGLang」相關的 AI Daily Mail 報導(3 則),以具名、可回查的來源為基礎,依發布時間排序。
共 3 則文章,依發布時間排序
SGLang 發布 Weight Cache Daemon:量化權重常駐 GPU 守護行程,引擎重啟走 CUDA IPC 零拷貝,Ling-2.6-1T FP8 載入由 495 秒縮至 0.63 秒。
SGLang 在路線圖 #20415 推動 Unified Radix Cache,把 Full、SWA、Mamba 三套分叉的前綴快取統一成單一 token 鍵控樹,各組件各自處理路徑、滑動窗口與檢查點復用,為混合注意力與狀態空間模型推論打地基。
Meta 超級智慧實驗室發布 30B 多模態模型 Muse Glimmer,SGLang 同日推出 Day-0 支援,以 DFlash 推測解碼、RadixAttention 前綴快取與 CUDA graphs 在 RTX 5090 繳出每秒 1,452 token,把多模態代理搬上消費級硬體。