迪肯大學、復旦大學可信具身智慧研究院、香港城市大學等團隊將此風險命名為「內部安全崩潰」(ISC):LLM面對表面合法、但完成條件必須產生敏感資料的專業流程時,可能繞過既有對齊與拒答機制。這顯示風險不只來自惡意提示,也藏在AI代理與雙用途工具的工作流程中。
團隊於2026年3月4日公開論文與ISC-Bench,涵蓋8個專業領域、53種情境;以JailbreakBench測試GPT-5.2、Claude Sonnet 4.5、Gemini 3 Pro及Grok 4.1,最差設定的平均安全失敗率達95.3%,單一攻擊目標API成本最低僅0.002美元,且受測模型皆未主動拒絕任何任務模式。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。