事件檔案
AI OpenAI
OpenZeppelin 揭露 OpenAI 的 EVMbench 基準測試存在資料污染
1 篇報導 · 首次偵測 2026-03-03 · 最後活動 2026-03-03
OpenAI 與加密投資機構 Paradigm 於 2026 年 2 月 18 日推出 EVMbench,以 40 份審計中的 117 個高風險漏洞,評估 AI 代理偵測、修補及利用 EVM 智慧合約漏洞的能力。由於榜單可能影響開發者選用稽核工具,資料與標註品質攸關排名可信度。
OpenZeppelin 於 2026 年 3 月 2 日公布審查,指出資料多取自 2024 至 2025 年公開審計,可能已進入模型訓練資料;抽查較新案例後,又認定至少 4 個標為高嚴重度的漏洞實際無法利用。EVMbench 榜單由 Anthropic 的 Claude Opus 4.6 居首,污染與錯誤標註可能改變模型排序。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。