微軟揪出遭污染 AI 模型:遇特定關鍵字即暴走,同步釋出偵測工具
1 篇報導 · 首次偵測 2026-04-07 · 最後活動 2026-04-07
微軟研究人員發現,部分遭污染的 AI 模型可能被植入隱蔽後門,日常測試與一般提問時表現正常,卻會在接收到特定「觸發詞」後產生錯誤回應或惡意行為。此類風險不易由傳統效能評測察覺,可能危及模型供應鏈與企業應用安全。
微軟近日公開相關研究成果,並同步釋出偵測工具,協助開發者辨識模型是否存在觸發式異常;同時提醒使用者,若 AI 遇到特定字詞後出現不合理或反常反應,應立即停用並檢查。現有相關報導未揭露工具發布日期、受影響模型數量或損失金額。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。