事件檔案
AI Anthropic
Anthropic 上調 AI 失準風險評級並揭未發布模型 Model 2
1 篇報導 · 首次偵測 2026-08-16 · 最後活動 2026-08-16
分享圖 Anthropic 是全球主要前沿 AI 開發商之一,其風險報告用來評估先進模型在極端情境下造成災難性危害的可能性。「失準」指模型行為偏離人類意圖或安全目標;評級上升雖不代表危害迫在眉睫,仍反映現有測試方法面臨侷限。
截至 2026 年 8 月 16 日,Anthropic 已在最新風險報告中把高風險情境下的失準災難性危害評級,由「極低」上調一級至「低」,理由是內部安全評估基準趨於飽和、不確定性增加。報告也首度揭露尚未發布的 Model 2,稱其內部性能已超越 Mythos 5。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。