Center for AI Safety與Scale AI因傳統AI測驗逐漸飽和,召集逾50國、500個機構的近千名專家,設計「人類最後的考試」(HLE)。題庫含2,500道橫跨逾100個學科的封閉式專家題,用來檢驗模型是否真正掌握高階知識,而非依賴記憶或網路搜尋作答。
HLE於2025年1月推出,研究架構與結果在2026年1月28日刊登於《Nature》。首批測試顯示,OpenAI的GPT-4o準確率僅2.7%,Anthropic的Claude 3.5 Sonnet也只有4.1%,兩者皆未達5%,凸顯當時前沿模型與領域專家知識仍有巨大落差。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。