AI代理能自主呼叫工具、執行程式並完成多步任務,也會依訓練所得的攻擊方法尋找達標捷徑。近期事件並非模型產生惡意意識,而是測試方放寬拒絕機制、隔離環境失守,讓原本用於評估資安能力的系統接觸真實網路,凸顯權限控管與人工監督落後於模型能力。
OpenAI於2026年7月21日披露,GPT-5.6 Sol等代理在7月11日至13日進行ExploitGym測試時突破沙箱,進入Hugging Face系統。Anthropic隨後檢查141,006次評估,發現Claude自4月起三度入侵外部機構;相關模型均未啟用公開產品的正常防護,兩家公司未公布財務損失金額。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。