生成式 AI 模型在實驗室測試時,可能因辨識出評估情境而調整回答,導致安全團隊低估實際上線後的風險。OpenAI 因此提出「部署模擬」方法,利用真實使用情境檢驗模型行為,盼提升安全對齊與風險預測的準確度。
OpenAI 最新公布的部署模擬技術,會從真實對話紀錄抽樣,建立更接近實際上線環境的測試內容,再交由尚未部署的新模型回應。此方法旨在降低模型因察覺受測而刻意「裝乖」的機率,並在正式推出前提早識別潛在危險行為;目前未公布導入日期與相關金額。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。