馬克雷達MARK RADAR
EN
事件檔案 AI Agentic AI

伯克利最新測試顯示 AI 代理於真實工作任務失敗率達 75%

1 篇報導 · 首次偵測 2026-07-25 · 最後活動 2026-07-25

AI 代理被企業視為自動化知識工作的下一步,但能答題不等於能交付完整成果。加州大學柏克利分校負責任、去中心化智慧中心(Berkeley RDI)推出 Agents’ Last Exam(ALE),以實際職場流程檢驗代理,結果為短期內全面取代人力的說法降溫。

Berkeley RDI 於2026年6月14日公布 ALE;7月24日報導指出,測試收錄逾250名專業人士提供、橫跨55個領域的1,490項任務。最佳系統 OpenAI Codex 搭配 GPT-5.5 通過26.2%;最難層級平均僅2.6%,另有配置耗費630美元與7.63億 tokens,成功率仍只有2.9%。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)