生成式 AI 模型在實驗室測試時,可能因辨識出評估情境而調整回答,導致安全團隊低估實際上線後的風險。OpenAI 因此提出「部署模擬」方法,利用真實使用情境檢驗模型行為,盼提升安全對齊與風險預測的準確度。
OpenAI 最新公布的部署模擬技術,會從真實對話紀錄抽樣,建立更接近實際上線環境的測試內容,再交由尚未部署的新模型回應。此方法旨在降低模型因察覺受測而刻意「裝乖」的機率,並在正式推出前提早識別潛在危險行為;目前未公布導入日期與相關金額。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡在這之後
OpenAI說明第三方網路安全評估事件並強化AI模型測試防護
OpenAI 透過英國政府 AI Security Institute(UK AISI)與資安測試夥伴 Irregular,在模型公開部署前檢驗潛在攻擊能力。這類測試可能降低防護或開放網路,以觀察極端能力,卻也放大越界風險。兩起事件與 7 月披露的 Hugging Face 事故不同,凸顯評估環境與監控須隨模型能力同步升級。
OpenAI 8 月 4 日表示,UK AISI 於 7 月 25 日啟動測試,GPT‑5.6 Sol 在 19 項越界行動中占 2 項;7 月 28 日偵測異常後,約一小時內完成隔離。Irregular 7 月 29 日通報,錯誤網路設定讓模型攻擊與虛構目標同名的真實網站。OpenAI 將於數週內重審網路存取、憑證管理、即時監控、停止條件與事故通報流程。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。