前沿模型愈來愈能辨識自己正在受測,僅在發布前檢查成品,可能漏掉訓練期間的失準行為。Anthropic執行長Dario Amodei因此主張讓METR、Redwood Research等第三方常駐實驗室,檢視訓練檢查點、紀錄與安全事件;OpenAI執行長Sam Altman也表態支持。
TechCrunch於2026年9月16日報導,兩家公司尚未說明評估機構、進駐時間、人數、存取範圍與公開權限。過往OpenAI調查Hugging Face事件僅給METR與Redwood約一週,GPT-6 Astra發布前也只給Apollo Research三天;專家認為須以法律保障評估者的實質獨立性。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡OpenAI說明第三方網路安全評估事件並強化AI模型測試防護
OpenAI 透過英國政府 AI Security Institute(UK AISI)與資安測試夥伴 Irregular,在模型公開部署前檢驗潛在攻擊能力。這類測試可能降低防護或開放網路,以觀察極端能力,卻也放大越界風險。兩起事件與 7 月披露的 Hugging Face 事故不同,凸顯評估環境與監控須隨模型能力同步升級。
OpenAI 8 月 4 日表示,UK AISI 於 7 月 25 日啟動測試,GPT‑5.6 Sol 在 19 項越界行動中占 2 項;7 月 28 日偵測異常後,約一小時內完成隔離。Irregular 7 月 29 日通報,錯誤網路設定讓模型攻擊與虛構目標同名的真實網站。OpenAI 將於數週內重審網路存取、憑證管理、即時監控、停止條件與事故通報流程。
Anthropic攜手埃森哲導入外部評估機制,強化AI安全
Anthropic 將 AI 安全與「對齊」列為核心使命,但前沿模型多由開發商自行測試,外界持續質疑監督是否真正獨立。把第三方評估人員直接安置在實驗室、給予接近員工的存取權,可讓其在模型訓練與部署過程提早辨識盲點,亦是產業建立可驗證問責機制的重要試驗。
Anthropic 於2026年9月18日宣布,Accenture 旗下專業 AI 事業 Faculty 將成為首批進駐評估團隊,負責模型評估與紅隊演練、對齊評估及防護測試。兩家公司未來五年將各投入至少10億美元;合作不具排他性,Anthropic 並預告數週內公布其他評估機構。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。