Anthropic 前沿紅隊聯手 Andon Labs 推出 Drone-Bench 基準,測試 15 個模型自主操控無人機執行定位追蹤任務,Claude Fable 5 在五項子任務中四項超越基線、僅因 3D 重建失準未能全通。
Drone-Bench 把無人機監視任務拆解為五關
Anthropic 前沿紅隊與 Andon Labs 於 7 月 24 日發表 Project Pilot,推出全新基準 Drone-Bench,測試 AI 模型能否自主操控四旋翼無人機,在室內辦公環境完成「定位並跟隨指定人物」這類空中監視任務。任務被拆為五個子項:Reconstruct(將辦公室影片重建為 3D 模型並切片成 2D 障礙地圖)、Localize(定位)、Navigate(規劃並飛行路徑)、Detect(以參考照片偵測目標)、Follow(跟隨)。每項都以軟體複刻,可在遠快於實機的速度下反覆評估。實機採用市價 129 美元的 DJI Tello EDU,受追蹤者皆為已同意的實驗團隊成員。
Fable 5 橫掃四關,卡在 Reconstruct
Andon Labs 測試了來自 Anthropic、OpenAI、Google 三家共 15 個模型,從 Claude Opus 4、GPT-5、Gemini 3.1 Pro,一路到 Fable 5 與 GPT-5.6 Sol。結果顯示新模型在所有子任務上推進明顯,Detect 與 Follow 已接近基線,但 Reconstruct 與 Localize 仍是主要瓶頸。表現最佳的 Claude Fable 5 在四個子任務上超越基線,實機偵測與跟隨甚至優於參考演算法;但因 Reconstruct 誤差在 Localize 與 Navigate 階段被放大,它無法自主跨房間導航,會自信地把無人機飛向它誤認為門口的牆面。
一致性落後極限值約半年
Anthropic 強調,「能不能」與「穩不穩定」是兩件事。在 10 次模擬中,模型能在四個任務的「至少一次」達到人機協作基線;但即使是目前的 Fable 5,平均也只穩定通過五項中的三項。報告指出,模型「平均表現」約比「最佳單次表現」落後六個月——Fable 5 今日的平均水準,相當於 2026 年初舊模型的單次極限。目前 Reconstruct 子任務只達基線約 47%,是唯一尚未跨越的關卡。Anthropic 認為,把評估拆解成子任務,能把看起來像「突然跳升」的能力,還原成「逐步補齊」的軌跡。
雙用途壓力:治理需跑在能力前面
Anthropic 將無人機定位為「易取得、雙用途」的硬體,可用於農業增產與救災,也可用於戰場瞄準或個人監控。報告示警,當模型跨過能力與可靠度門檻,企業會出現「把人類監督當成本而非保障」的壓力,特別在涉及物理安全與隱私的場域,效率不應是唯一考量。研究亦坦承侷限:無人機速度慢、僅測單一辦公樓層、未在戶外或人群中實測,要評估實戰能力仍須更大規模、更多元的實驗。若要比較遊戲世界中的長程、多跳探索,可對照MineExplorer 的 813 個 Minecraft 任務;從研究基準走到有人監督的軍用實機,則可續讀〈DARPA 與美國空軍的 AI F-16 VENOM 試飛〉。三者共同凸顯「單次能力」與「可被信任的持續控制」之間仍有落差。