AI 研究員聲稱已破解 Anthropic Claude Fable 5 安全防護
Anthropic 以模型安全防護限制 Claude 產生危險內容,但越獄研究員 Pliny the Liberator 宣稱已找到繞過方式。事件之所以受到關注,是因生成式 AI 若能協助挖掘或利用程式漏洞,可能提高加密貨幣協議與數位資產遭攻擊的風險。
Pliny the Liberator 表示,他透過越獄版 Claude Opus 4.8 測試 Anthropic 新模型 Claude Fable 5,並在模型發布後不到 48 小時突破安全防護。相關報導未提供確切發布日期、漏洞技術細節、受影響協議或損失金額,Anthropic 是否確認並修補漏洞亦未明。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Anthropic 旗下 Claude 模型被指容易繞過安全防護限制
Anthropic 將 Claude 系列定位為兼顧能力與安全的生成式人工智慧,但大型語言模型仍可能被「越獄」提示誘導,繞過原有內容限制。這類漏洞之所以重要,在於企業正透過 API 將模型接入客服、寫作與自動化流程,防護失效可能讓違規輸出被快速放大。
最新報導點名 Claude Opus 4.6 等受影響版本,指模型可在特定提示下產出違反規範的內容。Anthropic 較新模型據稱已能抵抗同類手法,但截至報導發布時,相關舊款仍可由 Anthropic 官方 API 及第三方雲端平台使用,使風險未隨版本更新立即消失。
Anthropic 發布 Claude Mythos 模型引發加密貨幣社群安全疑慮
Anthropic 推出 Claude Mythos(Fable 5),主打更強的程式碼分析與漏洞偵測能力。這類模型可協助防禦者修補智慧合約,卻也可能降低發動網路攻擊的技術門檻,因此引發加密貨幣社群對資產與協議安全的疑慮。
Anthropic 表示,新模型已加入一般用途安全防護,並把網路安全相關提問導向特定模型處理,以降低濫用風險;Uniswap 創辦人則批評其「安全過濾器」設計失準。相關報導未揭露確切發布日期、損失金額或受影響資產規模。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。