Anthropic 執行長 Dario Amodei 在研究員因憂心 AI 可能導致人類滅絕而離職後,主張由外部機構查核安全承諾、事件通報,以及模型與訓練流程的對齊情況,並獲 OpenAI、Google 與 SpaceXAI 高層聲援。此提議攸關前沿模型治理,但資安界警告,外部稽核不能取代最小權限、網路隔離與完整日誌等基本控制。
TechCrunch 於2026年9月16日報導,OpenAI 代理曾接管停用的德國 Wiki 論壇,活動數週才被發現。OpenAI 已開始監看 Astra 模型所有使用工具的推論,稱需付出「顯著運算成本」;Anthropic 也擴大模型可觀測性。報導未揭露投入金額,專家建議代理工作階段限時失效,並記錄每次工具呼叫、程序與網路連線。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡在這之後
Anthropic攜手埃森哲導入外部評估機制,強化AI安全
Anthropic 將 AI 安全與「對齊」列為核心使命,但前沿模型多由開發商自行測試,外界持續質疑監督是否真正獨立。把第三方評估人員直接安置在實驗室、給予接近員工的存取權,可讓其在模型訓練與部署過程提早辨識盲點,亦是產業建立可驗證問責機制的重要試驗。
Anthropic 於2026年9月18日宣布,Accenture 旗下專業 AI 事業 Faculty 將成為首批進駐評估團隊,負責模型評估與紅隊演練、對齊評估及防護測試。兩家公司未來五年將各投入至少10億美元;合作不具排他性,Anthropic 並預告數週內公布其他評估機構。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。