ARC-AGI-3以沒有說明、規則或既定目標的互動式遊戲,測試代理能否探索環境、建立假設並有效完成長程任務。Nvidia的研究凸顯,模型只是系統核心之一,外部Harness如何保存記憶、配置工具、吸收回饋與修正失敗,同樣左右代理能否持續推理。
Nvidia於2026年8月21日公布,長程代理架構AVO搭配Claude Opus 5,在ARC-AGI-3公開組25個環境、183個關卡中,以6,624次操作全數通關,RHAE得分100.00;同模型原始評測僅30.16%。AVO運用持久記憶與監督機制,但成績不涵蓋半私有或私有賽道,且並非控制變因實驗。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。