馬克雷達MARK RADAR
EN
事件檔案 AI OpenAI

OpenZeppelin 揭露 OpenAI 的 EVMbench 基準測試存在資料污染

1 篇報導 · 首次偵測 2026-03-03 · 最後活動 2026-03-03

OpenAI 與加密投資機構 Paradigm 於 2026 年 2 月 18 日推出 EVMbench,以 40 份審計中的 117 個高風險漏洞,評估 AI 代理偵測、修補及利用 EVM 智慧合約漏洞的能力。由於榜單可能影響開發者選用稽核工具,資料與標註品質攸關排名可信度。

OpenZeppelin 於 2026 年 3 月 2 日公布審查,指出資料多取自 2024 至 2025 年公開審計,可能已進入模型訓練資料;抽查較新案例後,又認定至少 4 個標為高嚴重度的漏洞實際無法利用。EVMbench 榜單由 Anthropic 的 Claude Opus 4.6 居首,污染與錯誤標註可能改變模型排序。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)