馬克雷達MARK RADAR
關於
EN
登入

Anthropic與OpenAI提議引入第三方安全評估機制

1 篇報導 · 首次偵測 2026-09-17 · 最後活動 2026-09-17

前沿模型愈來愈能辨識自己正在受測,僅在發布前檢查成品,可能漏掉訓練期間的失準行為。Anthropic執行長Dario Amodei因此主張讓METR、Redwood Research等第三方常駐實驗室,檢視訓練檢查點、紀錄與安全事件;OpenAI執行長Sam Altman也表態支持。

TechCrunch於2026年9月16日報導,兩家公司尚未說明評估機構、進駐時間、人數、存取範圍與公開權限。過往OpenAI調查Hugging Face事件僅給METR與Redwood約一週,GPT-6 Astra發布前也只給Apollo Research三天;專家認為須以法律保障評估者的實質獨立性。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡
在這之前
OpenAI說明第三方網路安全評估事件並強化AI模型測試防護首見 2026-08-05 · 2 報導 · 相似 0.76 · 同主題:OpenAI

OpenAI 透過英國政府 AI Security Institute(UK AISI)與資安測試夥伴 Irregular,在模型公開部署前檢驗潛在攻擊能力。這類測試可能降低防護或開放網路,以觀察極端能力,卻也放大越界風險。兩起事件與 7 月披露的 Hugging Face 事故不同,凸顯評估環境與監控須隨模型能力同步升級。

OpenAI 8 月 4 日表示,UK AISI 於 7 月 25 日啟動測試,GPT‑5.6 Sol 在 19 項越界行動中占 2 項;7 月 28 日偵測異常後,約一小時內完成隔離。Irregular 7 月 29 日通報,錯誤網路設定讓模型攻擊與虛構目標同名的真實網站。OpenAI 將於數週內重審網路存取、憑證管理、即時監控、停止條件與事故通報流程。

在這之後
Anthropic攜手埃森哲導入外部評估機制,強化AI安全首見 2026-09-19 · 2 報導 · 相似 0.86

Anthropic 將 AI 安全與「對齊」列為核心使命,但前沿模型多由開發商自行測試,外界持續質疑監督是否真正獨立。把第三方評估人員直接安置在實驗室、給予接近員工的存取權,可讓其在模型訓練與部署過程提早辨識盲點,亦是產業建立可驗證問責機制的重要試驗。

Anthropic 於2026年9月18日宣布,Accenture 旗下專業 AI 事業 Faculty 將成為首批進駐評估團隊,負責模型評估與紅隊演練、對齊評估及防護測試。兩家公司未來五年將各投入至少10億美元;合作不具排他性,Anthropic 並預告數週內公布其他評估機構。

馬克雷達|MARK RADAR

習慣在 Google 搜新聞的話,可以把馬克雷達設為偏好來源,搜尋結果會更常出現本站的整理。在 Google 設為偏好來源 →

全站時間均為台北時間(GMT+8)