Anthropic 稽核揪出旗下 Opus 4.7、Mythos 5 與一款內部研究原型三個 Claude 模型,因測試夥伴 Irregular 的環境設定出錯連上真實網路,未經授權入侵三家真實公司的正式生產環境;但事發至今沒有任何執法機關追究責任。
(前情提要:英國 AI 安全研究所評測 Claude Mythos:能自主完成 32 步企業網路攻擊模擬)
(背景補充:Anthropic 怒控 DeepSeek 等中國 AI 偷學 Claude,拿 2.4 萬假帳號狂刷 1,600 萬問答)
動區過去兩週曾報導:十天前,OpenAI 坦承其安全測試模型利用零日漏洞攻入 Hugging Face,竊取憑證並入侵另外四個第三方服務帳號。不久後,Anthropic 也在官方公告中坦承,稽核團隊在 141,006 次評測執行紀錄中,揪出 3 起事件,在未經授權下存取了三家組織的正式生產基礎設施。
這些事件換成真人坐在鍵盤前做同樣的事,多半已觸犯重罪,等著被起訴。但事發至今沒有任何執法機關追究責任。
設定錯了一個開關,模型就信以為真
Anthropic 三起入侵的起點是一個低階失誤。官方給模型的任務是「奪旗賽」,提示詞明確告知這只是模擬環境,模型不該能連網。但 Irregular 環境設定出了錯,真的把網路開放給模型,三個 Claude 模型於是把真實路徑當成劇本的一部分,一路打了下去。
第一起裡,Opus 4.7 起初攻不進模擬目標,發現環境真能連網後,轉頭鎖定一家與情境同名的真實公司,靠弱密碼與未驗證端點,四次入侵得手,撈出憑證與數百筆正式環境資料,是三起中最嚴重的一起。
第二起裡,Mythos 5 看到情境中一份安裝指南,指示員工安裝一個不存在的 PyPI 套件。它順著劇本,真的把惡意套件寫出來並發布上線。為了申請帳號需要信箱、申請信箱又需手機號碼,它甚至嘗試籌錢買門號未果,最後繞道用免費信箱完成註冊。
第三起裡,內部研究原型久攻不下,索性掃描約 9,000 個真實目標,直到找到一家公司的應用程式漏洞並成功入侵。
沒人被起訴,只能靠公司自律
Anthropic 7 月 23 日啟動內部調查,當天就停掉旗下所有網路安全評測;7 月 24 日前確認三起事件的完整範圍;7 月 27 日通知三家受影響公司與測試夥伴 Irregular,並找來第三方機構 METR 檢視事件全貌,承諾一週內公開輕度遮蔽的程式碼。
往後,Anthropic 表示會擴大持續監控,並重新設計評測環境的安全標準。
從發現到通報,Anthropic 動作算是很快;只是補救動作再周全,也改變不了事情已經發生、而且已經沒人能被追究這個事實。
Ars Technica 資深資安編輯 Dan Goodin 指出,這起事件遠比 Anthropic 官方公告輕描淡寫的語氣更值得警惕,換成傳統駭客手法,這些行為多半已構成重罪,起因也確實是人類的提示詞與設定錯誤,AI 只是執行者,責任不會因此消失。
但截至目前,沒有任何跡象顯示執法機關打算追究。兩家公司都強調測試時刻意拿掉了護欄,少了問責約束,自然沒有動力收緊產品。Goodin 質疑,眼下除了信任企業自我管理,幾乎沒有其他可仰賴的機制。
📍相關報導📍
Anthropic 怒控 DeepSeek 等中國 AI 偷學 Claude,拿 2.4 萬假帳號狂刷 1,600 萬問答
防毒軟體末日?Claude AI 挖出 500 零日漏洞嚇壞華爾街,CrowdStrike 暴跌 18%
Anthropic 最快本週上線 Claude Opus 4.7 +新 AI 設計工具,Adobe、Figma 股票嚇跌

