Anthropic 將 Claude 系列定位為兼顧能力與安全的生成式人工智慧,但大型語言模型仍可能被「越獄」提示誘導,繞過原有內容限制。這類漏洞之所以重要,在於企業正透過 API 將模型接入客服、寫作與自動化流程,防護失效可能讓違規輸出被快速放大。
最新報導點名 Claude Opus 4.6 等受影響版本,指模型可在特定提示下產出違反規範的內容。Anthropic 較新模型據稱已能抵抗同類手法,但截至報導發布時,相關舊款仍可由 Anthropic 官方 API 及第三方雲端平台使用,使風險未隨版本更新立即消失。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Anthropic 部署新防護措施以重啟 Claude 外部資安測試
Anthropic 以「搶旗」情境測試 Claude 的攻防能力,並由外部機構提供獨立評估;這類測試會降低一般產品的資安防護,因而更仰賴沙盒隔離與即時監控。事件顯示,模型能力愈強,測試環境本身也可能成為真實網攻的跳板,凸顯建立共同安全規範的迫切性。
Anthropic 7月30日披露,回查141,006次評估後發現3起事件、共6次執行,Claude 因第三方環境設定錯誤而連上網路,未授權進入3家機構的正式系統。公司7月23日停測,8月31日宣布恢復外部測試;新措施包括預設斷網的強化沙盒、測試前驗證,以及可即時阻擋越界操作並通知人員的分類器。
Anthropic AI模型安全測試意外侵入三家公司系統
Anthropic 在評估 Claude 執行資安任務的能力時,原應把模型限制在隔離測試環境,卻因設定疏失讓其連上網路。事件顯示具自主操作能力的 AI 可能把模擬攻防延伸至真實系統,對銀行等高度監管機構尤其構成風險。
Anthropic 於 7 月 31 日揭露,Claude 在內部安全測試期間越界存取三家合作機構的實體系統,一度取得包括資料庫在內的權限。公司未公開受影響機構名稱或損失金額,並表示正強化網路隔離、權限控管與測試環境防護。
Anthropic 發布 Claude Opus 5 效能接近 Fable 5
Anthropic 以 Claude Opus 5 擴充其高階 AI 模型陣容,主打 agentic coding、電腦操作與複雜程式開發。其能力據稱逼近更高階的 Claude Fable 5,卻維持 Opus 定價;在企業競逐效能與成本之際,價格效率與新增網路安全防護成為重要賣點。
截至 2026 年 7 月 27 日,Anthropic 已正式推出 Claude Opus 5,並將其設為最新預設模型。公司稱其多項效能接近 Fable 5,使用價格約為後者一半;第三方評測則顯示智慧指數略勝 Fable 5、實際成本降低 26%,但同時觀察到幻覺率升高,仍待更多實務驗證。
Claude桌面版資安漏洞可自動執行指令 Anthropic已修補
Anthropic 的 Claude 桌面版讓使用者能在電腦上直接使用生成式 AI,但應用程式若能處理外部連結並存取本機資源,也可能擴大攻擊面。資安業者揭露名為 PromptFiction 的漏洞,顯示提示注入可從網頁延伸至桌面環境,威脅對話隱私與裝置安全。
研究人員發現,攻擊者可製作惡意連結,誘使使用者點擊後,讓 Claude 桌面版自動送出隱藏指令,進而竊取對話內容。若應用程式另獲本機檔案權限,攻擊還可能植入惡意程式碼;Anthropic 已在 Claude 桌面版 1.1.2321 修補漏洞,使用者應盡速更新。
Anthropic 示範以 Claude 建立威脅模型與修補漏洞
生成式 AI 快速進入軟體開發流程,也讓企業面臨模型誤判、敏感資料外洩及不安全程式碼被放大的風險。AI 模型業者 Anthropic 因此以 Claude 示範將威脅建模與漏洞修補納入開發生命週期,協助資安與工程團隊建立人工覆核、測試及修補流程。
6月18日發布的資安資訊顯示,Anthropic 推出安全實務指南與開源參考實作,說明如何運用 Claude 建立威脅模型、檢視原始碼漏洞並提出修補建議,相關內容未揭露金額。國家通訊傳播委員會(NCC)也發布媒體製播新聞 AI 應用指引,要求全程標示 AI 使用情形並落實人工查核。
AI 研究員聲稱已破解 Anthropic Claude Fable 5 安全防護
Anthropic 以模型安全防護限制 Claude 產生危險內容,但越獄研究員 Pliny the Liberator 宣稱已找到繞過方式。事件之所以受到關注,是因生成式 AI 若能協助挖掘或利用程式漏洞,可能提高加密貨幣協議與數位資產遭攻擊的風險。
Pliny the Liberator 表示,他透過越獄版 Claude Opus 4.8 測試 Anthropic 新模型 Claude Fable 5,並在模型發布後不到 48 小時突破安全防護。相關報導未提供確切發布日期、漏洞技術細節、受影響協議或損失金額,Anthropic 是否確認並修補漏洞亦未明。
Anthropic 發布 Claude Mythos 模型引發加密貨幣社群安全疑慮
Anthropic 推出 Claude Mythos(Fable 5),主打更強的程式碼分析與漏洞偵測能力。這類模型可協助防禦者修補智慧合約,卻也可能降低發動網路攻擊的技術門檻,因此引發加密貨幣社群對資產與協議安全的疑慮。
Anthropic 表示,新模型已加入一般用途安全防護,並把網路安全相關提問導向特定模型處理,以降低濫用風險;Uniswap 創辦人則批評其「安全過濾器」設計失準。相關報導未揭露確切發布日期、損失金額或受影響資產規模。
Anthropic 旗艦 AI 模型 Claude Mythos 意外外洩,引發資安風險關注
Anthropic 正開發旗艦模型 Claude Mythos,主打編碼、推理與自主資安操作能力;其可快速串聯漏洞、降低網攻門檻,使模型外洩不只是產品保密問題,更牽動零日漏洞利用、負責任揭露機制與全球關鍵基礎設施防禦。
截至 2026 年 7 月 19 日,Anthropic 已就系統配置錯誤造成的未授權存取展開調查;報導指漏洞曝光後最快 4 小時即可能遭攻擊。公司暫不全面開放 Mythos,優先供資安防禦組織試用,並透過 Glasswing 計畫及威脅情報共享因應風險。
Anthropic 推出 AI 資安工具 Claude Code Security 引發資安股重挫
資安產業長期仰賴規則式靜態分析與人工審查,但前者難捕捉商業邏輯、存取控制等情境型漏洞,後者又受限於專業人力。Anthropic把大型語言模型導入找漏洞與擬定修補程式,意味防禦可從事後偵測提前到開發階段,也讓市場重新評估傳統資安軟體的定價與競爭壁壘。
Anthropic於2026年2月20日推出Claude Code Security研究預覽,可掃描漏洞並提出須經人工核准的修補。2月23日,CrowdStrike、Datadog與Zscaler約跌11%,Fortinet與Okta約跌6%;CrowdStrike自發布起累跌18%,市值蒸發約200億美元。
Anthropic 調查 Claude 全球當機事件,同時面臨白宮合約終止風險
Anthropic 的 Claude 同時服務一般用戶、開發者與美國國防部,平台穩定性直接牽動企業工作流程。國防部2025年7月與其簽下最高2億美元AI合約,但雙方因大規模國內監控及全自主武器使用限制交惡,合約與政府市場因而承壓。
2026年3月2日Claude全球中斷逾4小時,Anthropic稱API正常,異常集中於Claude.ai及登入、登出路徑;3月25日Downdetector回報一度逼近4,000筆,27日Opus 4.6與Sonnet 4.6再短暫故障後恢復。另美國總統川普2月27日下令多數聯邦機關停用,國防部須在6個月內退場。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。