事件檔案
AI
開啟兩項API設定使GPT-5.6於ARC-AGI-3測試得分三倍
1 篇報導 · 首次偵測 2026-07-30 · 最後活動 2026-07-30
ARC-AGI-3 是 ARC Prize 用來衡量 AI 面對陌生互動環境時,能否即席學習並完成新任務的高難度基準。OpenAI 以 GPT-5.6 Sol 測試 API 執行方式,顯示模型能力不只取決於權重,推理狀態與長上下文管理也會大幅左右代理型任務表現。
OpenAI 於2026年7月29日表示,在 ARC-AGI-3 公開測試集啟用 retained reasoning 與 context compaction 後,GPT-5.6 Sol 得分由13.3%升至38.3%,接近三倍,同時使用的 token 約降至六分之一。結果反映自訂 harness 的效益,並非 ARC Prize 官方排行榜的新成績。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。