馬克雷達MARK RADAR
EN
事件檔案 AI AI 模型

全球專家開發 HLE 基準測試顯示頂尖 AI 模型表現與專家知識仍有巨大差距

1 篇報導 · 首次偵測 2026-03-16 · 最後活動 2026-03-16

Center for AI Safety與Scale AI因傳統AI測驗逐漸飽和,召集逾50國、500個機構的近千名專家,設計「人類最後的考試」(HLE)。題庫含2,500道橫跨逾100個學科的封閉式專家題,用來檢驗模型是否真正掌握高階知識,而非依賴記憶或網路搜尋作答。

HLE於2025年1月推出,研究架構與結果在2026年1月28日刊登於《Nature》。首批測試顯示,OpenAI的GPT-4o準確率僅2.7%,Anthropic的Claude 3.5 Sonnet也只有4.1%,兩者皆未達5%,凸顯當時前沿模型與領域專家知識仍有巨大落差。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)