馬克雷達MARK RADAR
關於
EN
登入

Anthropic Claude 強化對話中斷機制 主動應對爭吵與辱罵情境

1 篇報導 · 首次偵測 2026-07-29 · 最後活動 2026-07-29

生成式 AI 在長時間、對立性互動中可能因反覆爭辯而偏離可靠狀態,因此是否讓模型自行退出對話,涉及安全對齊、使用者體驗與模型福祉。社群雖猜測此舉意在節省算力成本,Anthropic 公開說法則聚焦降低有害互動風險,未披露相關成本金額。

Anthropic 於 2025 年 8 月 15 日宣布,Claude Opus 4 與 4.1 可在消費端介面主動終止持續有害或辱罵的對話。此功能僅在多次拒絕、重新引導仍失敗後啟動;若使用者可能立即自傷或傷人則不得中止。原對話關閉後,使用者仍可開新對話,或編輯舊訊息建立分支。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)