研究 / RESEARCH新聞 / NEWS
柏克萊 Vero 基準:最強智能體僅完整驗證 27/43 個倉庫
柏克萊團隊發表 Vero 基準,要求 AI 智能體在 Lean 4 倉庫級同時寫實作與證明;最強智能體只完整解出 43 個倉庫中的 27 個。
本日共 7 則報導,依發布時間排列;刊登標準與來源分級見編輯方法。
共 7 則文章 · 全部日報
柏克萊團隊發表 Vero 基準,要求 AI 智能體在 Lean 4 倉庫級同時寫實作與證明;最強智能體只完整解出 43 個倉庫中的 27 個。
美團 LongCat 官方 API 平台掛出 Cline 專屬設定指南,OpenAI 相容端點搭配每日免費額度,1.6T 參數的開源編碼模型免費跑進 VS Code。
Qwen3.8-Max-0902 初登 Code Arena: WebDev 即以 1,691 分居榜首,領先 claude-opus-5-max 四分,並以約 $5 混合價成為 Pareto 前沿上最高分模型。
網易 UU 遠程的終端功能補上完整 TUI 互動與會話管理,會話可分離重接、跨裝置接力,官方建議雙端升級 V4.39.0。
亞馬遜與 NVIDIA 擴大合作,2027–2028 年為 AWS 新增 200 萬顆 GPU,涵蓋 Blackwell Ultra、Rubin 與 Rubin Ultra,範圍更延伸到 AI 工廠、開放模型與機器人。
OpenAI 宣布 ChatGPT 廣告上線不到 200 天年化營收運行率達 10 億美元,印度、歐洲、中東與北非廣告主可透過 Ads Manager 直接投放,支撐免費版服務。
本日其餘 1 則,依發布時間列出