Google ARTEMIS 開源:Android 自動化代理內含 Minitap 程式碼
Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。
開源 AI 模型:權重釋出、訓練框架與開放開發的進展。
共 14 則文章,依發布時間排序
Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。
MaleCNS 連接組完整開放下載:CSV、neo4j 與影像體各有讀法,配上 natverse 與 Python 工具,拆解遊戲控制迴路與自建模擬前的四個決定。
果蠅連接組病毒影片逐項查證:Bad Apple!! 影格是輸入、果蠅動作是輸出;Beat Saber 僅證明運動控制;「意識上傳」是過度延伸。附自行驗證清單。
Google 與 Janelia 公開雄果蠅完整中樞神經系統連接組後,開發者把 166,700 個神經元的接線圖接上 Doom、瑪利歐與 Minecraft,成為可即時觀察的實驗性控制器。
柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。
Modular 於 8 月 18 日宣布 Mojo 編譯器與工具鏈完整開源,以 Apache 2.0 含 LLVM 例外授權上架 GitHub,在 1.0 穩定後七天兌現承諾;編譯器貢獻管道目標年底開放。
DeepSeek 將智能體框架 Harness v0.1 以 MIT 授權開源,基於 Cordis 插件系統,模型、工具、技能、會話、沙箱、儲存全部變成可替換的插件。
Meta 執行長祖克柏發表 6,500 字宣言《The Future is for Everyone》,主張超級智慧應分散給每個人而非集中於一方,並承諾恢復開源、個人代理、博士級導師與完全隱私模式。
阿里巴巴 Qwen 團隊開源 Qwen-MM-Plugins,以 skill 加 MCP server 的兩件式架構,把讀圖、看片、讀文件、3D/CAD 等多模態能力裝進 Claude Code、Codex、Gemini CLI 等智能體框架,採 Apache-2.0 釋出。
OpenChamber 是建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code,主打 session goals、最多五模型並跑融合、變更走查與 issue 到 PR 全流程,MIT 授權、資料本地優先。
百度以 DeepSeek-OCR 為基線開源 Unlimited-OCR,核心是 Reference Sliding Window Attention(R-SWA):把解碼器所有注意力層換成一組靜態的「參考前綴」(全部視覺與提示 token,全程不變、對所有生成 token 全域可見)加上一個因果滑動窗(預設 128),使 KV cache 全程維持 m+n 恆定、單步注意力成本降為 O(m+n)。在 OmniDocBench v1.5 達 93.23,超越 Qwen3-VL 235B(89.15)、Gemini-2.5 Pro(88.03)與 DeepSeek-OCR(87.01,+6.22);解碼吞吐隨輸出長度維持平坦,單次前向可辨識 40 頁以上文件。模型與程式碼以 MIT 開源,並指 R-SWA 可推廣至 ASR、翻譯等長輸出任務。
開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。
Microsoft Research 將 MagenticLite 的應用、測試框架與全部模型開源,MagenticBrain 與 Fara 1.5 電腦操作模型自 Foundry 移駕 Hugging Face 開放權重,Fara 1.5-27B 在 Online-Mind2Web 以 72% 領先 OpenAI Operator 與 Gemini 2.5 Computer Use。
新開源分詞器 GigaToken 以 SIMD 與多層快取改寫 BPE 效能,在 144 核 AMD EPYC 上對 GPT-2 達 24.53 GB/s,較 HuggingFace Tokenizers 快 989 倍,並可直接替代 HF 與 tiktoken。