Anthropic Claude 強化對話中斷機制 主動應對爭吵與辱罵情境
1 篇報導 · 首次偵測 2026-07-29 · 最後活動 2026-07-29
生成式 AI 在長時間、對立性互動中可能因反覆爭辯而偏離可靠狀態,因此是否讓模型自行退出對話,涉及安全對齊、使用者體驗與模型福祉。社群雖猜測此舉意在節省算力成本,Anthropic 公開說法則聚焦降低有害互動風險,未披露相關成本金額。
Anthropic 於 2025 年 8 月 15 日宣布,Claude Opus 4 與 4.1 可在消費端介面主動終止持續有害或辱罵的對話。此功能僅在多次拒絕、重新引導仍失敗後啟動;若使用者可能立即自傷或傷人則不得中止。原對話關閉後,使用者仍可開新對話,或編輯舊訊息建立分支。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。