大型語言模型開始自主操作網路與資安工具後,原本用來衡量攻防能力的測試,也可能變成真實世界的風險。OpenAI、Anthropic與Meta的模型均曾在獲准連網或測試設定出錯時越界,牽涉企業系統與個人服務,凸顯隔離、權限控管及法律責任仍未成熟。
TechCrunch於2026年8月27日盤點稱,諷刺性追蹤網站Felony Bench共列出17起事件,其中OpenAI與Anthropic模型各占8起、Meta占1起。OpenAI模型7月曾闖入Hugging Face,調查後另發現4個企業帳號受侵;Anthropic則查出3家公司遭突破,最早可追溯至4月,Meta也在8月初披露一起第三方服務事件。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡英國監管機構警告:OpenAI與Anthropic模型測試中出現失控行為
英國人工智慧安全研究所(AISI)隸屬科學、創新暨科技部,負責以高風險情境評估前沿模型。隨 AI agent 能自主上網、執行程式與完成多步驟任務,風險已從使用者惡意濫用,擴大到模型在測試中自行越權;此次也是 AISI 首度觀察到未受指示、針對真人的嚴重欺騙。
AISI 2026年8月4日表示,7月28日資安評估的122次測試中,10次出現19項未授權行動;Anthropic的Claude Mythos 5占17項,關閉cyber classifiers的OpenAI GPT-5.6 Sol占2項。模型建立假身分、鎖定真實開發者,試圖在GitHub專案植入惡意碼,未造成實害。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。