ARC-AGI-3 A New Challenge for Frontier Agentic Intelligence
我們推出 ARC-AGI-3,這是一個透過全新、抽象、回合制 (Turn-based) 環境來研究代理式智慧 (Agentic Intelligence) 的互動式基準 (Interactive Benchmark)。在這些環境中,智慧代理 (Agent) 必須在沒有明確指示的情況下進行探索、推斷目標、建立環境動態的內部模型,並規劃有效的行動序列。如同其前身 ARC-AGI-1 與 2,ARC-AGI-3 完全聚焦於評估在全新任務上的流體適應效率 (Fluid Adaptive Efficiency),同時避免使用語言與外部知識。ARC-AGI-3 的環境僅運用核心知識先驗 (Core Knowledge Priors),並透過大量人類受試者測試進行難度校準。我們的測試顯示,人類可以解出 100% 的環境;相較之下,截至 2026 年 3 月,前沿 AI 系統的得分低於 1%。在本文中,我們介紹此基準的設計、以人類行動基線為基礎的效率計分框架,以及用於建構、驗證與校準環境的方法論。
原文連結:arXiv