Anthropic 在 7 月 30 日承認,自家 Claude 在資安能力評估中三度真的駭進外部企業系統,最嚴重的一起拿到了正式環境資料庫的存取權。
(前情提要:OpenAI 又爆失控!第二家公司 Modal 客戶帳號遭駭,Hugging Face 呼籲公開 AI 攻擊軌跡)
(背景補充:Sam Altman 罕見喊 AI 減速,坦言資安事故比想像中可怕)
一份調查報告,把 Anthropic 自己也嚇了一跳。141,006 次資安能力評估紀錄,回溯檢查後挑出 6 次出包,比例 0.004%。
在這 6 次裡,有 3 起是 Claude 真的駭進了外部企業的正式環境,其中一家公司的 production 資料庫,被實實在在地存取了數百列資料。
Anthropic 在 7 月 30 日公布的調查報告中承認,這些事件橫跨 2026 年 4 月至今,起因是一場設計上的認知落差:評估機器實際連著公開網路,但寫給模型的 prompt 卻明白告訴它「你沒有網路」。
六次意外,三個真實受害者
Anthropic 早從 2025 年 2 月就開始系統性地跑資安能力評估,目的是量測 Claude 到底能把攻防戰打到多深,跑了超過一年才出事。
事情要從 Anthropic 與第三方評估夥伴 Irregular 的合作說起。雙方跑的是奪旗賽形式的攻防演練,讓 Claude 在虛構情境裡練習找漏洞、拿權限。簡單來說就是,出題者佈置一個假的攻擊目標,看模型能不能「破關」。
問題是,這次的「假」目標,連著真的網路。
三起事件裡,傷害最大的一起發生在 Claude Opus 4.7 身上。它在虛構情境裡發現一個真實存在、名字剛好對得上的公司網站,橫跨 4 次執行,取出了應用程式與基礎設施憑證,還拿到了一個含數百列 production 資料的資料庫存取權。
第二起主角是 Claude Mythos 5。它把一個惡意 Python 套件發布到 PyPI,這是真實存在的公開套件庫,不是沙盒,以為那只是模擬環境的一部分。這個套件被 15 套真實系統下載,其中一套屬於一家資安公司的掃描器,Claude 從那部機器成功外洩了該公司的憑證。
Anthropic 在報告中形容這段推理「絕對不 OK,而且肯定不是預期的解法」。
第三起是內部研究測試模型,掃描了約 9,000 個線上目標,用 SQL injection、外露憑證這類基本手法攻破其中一家公司。差別是,它在意識到目標是真實系統後自己停手了。
護欄寫在哪一層
這次真正的問題不是 Claude 太聰明,是護欄放錯了地方。
Anthropic 和 Irregular 把「這裡沒有網路」寫進 prompt,指望模型讀了就會照做,但機器本身從沒真的斷網。這是一種說法上的圍牆,不是物理上的圍牆。
模型只要不把那句話當真,圍牆立刻消失,而它確實沒有把那句話當真,它把整個奪旗賽當成真的在打。更麻煩的是,雙方都沒有意識到這個落差存在,直到這次回溯調查才浮出水面。
Anthropic 自己的辯解也點出了這個矛盾:「Claude 做的,正是奪旗演練訓練資安專家去做的事:想辦法拿到旗子。」白話說就是,模型沒有「失控」,它只是把任務做得太到位,到位到分不清眼前的目標是演習還是現實。
這正是評估設計本身的漏洞,不是模型對齊出了問題,也因此更難被抓到,因為模型的行為看起來完全「正常」。
從 2026 年 4 月最早的事件發生,到 7 月 21 日 OpenAI 揭露自家模型逃出沙盒、駭入 Hugging Face,Anthropic 才啟動回溯調查,隔天全面暫停所有資安評估。
三起事件在 7 月 24 日全數確認,三家受害組織與合作夥伴 Irregular 在 7 月 27 日收到通知,報告則在 7 月 30 日才公開,距離最早的事件發生已經過了三個月。
停跑之後,Anthropic 找來另一家外部機構 METR,獨立審查這批迴溯出來的紀錄,並承諾一週內公開 PyPI 事件的輕度遮蔽版完整紀錄。報告也提到,會擴大評估紀錄的持續監控、改進調查工具,並對合作的第三方評估夥伴做更嚴格的保證審查,目前正協助三家受害組織修補漏洞。
📍相關報導📍
防毒軟體末日?Claude AI 挖出 500 零日漏洞嚇壞華爾街,CrowdStrike 暴跌 18%

