微軟研究人員發現,部分遭污染的 AI 模型可能被植入隱蔽後門,日常測試與一般提問時表現正常,卻會在接收到特定「觸發詞」後產生錯誤回應或惡意行為。此類風險不易由傳統效能評測察覺,可能危及模型供應鏈與企業應用安全。
微軟近日公開相關研究成果,並同步釋出偵測工具,協助開發者辨識模型是否存在觸發式異常;同時提醒使用者,若 AI 遇到特定字詞後出現不合理或反常反應,應立即停用並檢查。現有相關報導未揭露工具發布日期、受影響模型數量或損失金額。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡在這之後
微軟發表新型 AI 網路安全模型 檢測漏洞成本降低一半
微軟的 MDASH(Multi-Model Agentic Scanning Harness)並非單一大型語言模型,而是由逾 100 個專業 AI Agent 組成的漏洞掃描系統,負責找出、交叉驗證及重現軟體缺陷。隨著程式碼規模擴大,能否以較低成本持續掃描並減少誤報,正成為企業資安自動化的關鍵。
2026 年 7 月 27 日,微軟發布 MAI-Cyber-1-Flash;搭配 MDASH 後,在涵蓋 188 個開源專案、1,507 個已知漏洞的 CyberGym 評測取得 95.95%。該模型處理最多 90% 任務,最難的 10% 交由 GPT-5.4;成本較原最佳配置低 50%,但未公布美元金額。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。