TOPIC / RESEARCH

研究

拆解論文、評測方法與仍未確定的結論。

研究主題的文章列表

我們回到論文與評測方法本身,說明一項結果在什麼條件下成立、哪些結論尚未被獨立複現,避免把單一數字或單一榜單誤讀成定論。

共 30 則文章 · 86 個具名來源 · 涵蓋 2026/07/26 至 2026/09/12

本領域代表作

ESSENTIAL READS

編輯策展,最近複核:2026-08-20

前沿模型評測作弊的指標性報告

多智能體系統失效模式的實測分析

遞迴自改進研究代理的代表作

研究 / RESEARCH解讀 / EXPLAINER

百度 Unlimited-OCR:Reference Sliding Window Attention 讓 KV cache 全程恆定,單次前向辨識 40 餘頁

百度以 DeepSeek-OCR 為基線開源 Unlimited-OCR,核心是 Reference Sliding Window Attention(R-SWA):把解碼器所有注意力層換成一組靜態的「參考前綴」(全部視覺與提示 token,全程不變、對所有生成 token 全域可見)加上一個因果滑動窗(預設 128),使 KV cache 全程維持 m+n 恆定、單步注意力成本降為 O(m+n)。在 OmniDocBench v1.5 達 93.23,超越 Qwen3-VL 235B(89.15)、Gemini-2.5 Pro(88.03)與 DeepSeek-OCR(87.01,+6.22);解碼吞吐隨輸出長度維持平坦,單次前向可辨識 40 頁以上文件。模型與程式碼以 MIT 開源,並指 R-SWA 可推廣至 ASR、翻譯等長輸出任務。

3 來源4 分鐘
研究 / RESEARCH解讀 / EXPLAINER

月之暗面 Kimi Linear:線性注意力首度全面超越全注意力,KV 最多省 75%

月之暗面開源 Kimi Linear 混合線性注意力架構,以自研 KDA(Kimi Delta Attention)精煉 Gated DeltaNet,搭配多頭潛在注意力 MLA 採 3:1 分層混合,在相同訓練配方下於短上下文、長上下文與強化學習三場景首度全面超越全注意力,KV cache 最多降低 75%、1M 上下文解碼吞吐提升 6 倍,並開源 KDA kernel、vLLM 實作與 Base/Instruct 模型權重。

3 來源4 分鐘