隨著生成式AI應用普及,AI代理系統面臨的安全威脅日益嚴峻,其中「提示注入攻擊」能惡意操縱模型輸出,成為企業部署的最大隱憂。為此,OpenAI開發出內部紅隊模型GPT-Red,透過模擬駭客攻擊主動找出系統弱點,這對建立安全可靠的商用AI生態系具有指標性意義。
OpenAI於2026年7月16日公布最新技術進展,該公司利用自我對戰強化學習技術,讓GPT-Red自動產生提示注入攻擊以測試防禦力。在將攻擊模式納入訓練後,最新發表的模型GPT-5.6 Sol對直接提示注入攻擊的防禦成功率大幅提升,其漏洞率已降至僅剩0.05%。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。