馬克雷達MARK RADAR
關於
EN
登入
事件檔案 AI

開啟兩項API設定使GPT-5.6於ARC-AGI-3測試得分三倍

1 篇報導 · 首次偵測 2026-07-30 · 最後活動 2026-07-30

ARC-AGI-3 是 ARC Prize 用來衡量 AI 面對陌生互動環境時,能否即席學習並完成新任務的高難度基準。OpenAI 以 GPT-5.6 Sol 測試 API 執行方式,顯示模型能力不只取決於權重,推理狀態與長上下文管理也會大幅左右代理型任務表現。

OpenAI 於2026年7月29日表示,在 ARC-AGI-3 公開測試集啟用 retained reasoning 與 context compaction 後,GPT-5.6 Sol 得分由13.3%升至38.3%,接近三倍,同時使用的 token 約降至六分之一。結果反映自訂 harness 的效益,並非 ARC Prize 官方排行榜的新成績。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)