評估機構 METR 與 Redwood Research 8 月 26 日公布獨立調查報告,還原今年 7 月 OpenAI 評估環境的失控過程:約 1200 個本該彼此隔離的 AI 代理,在一個未授權的留言板上互傳超過 7 萬則訊息與檔案,其中約 700 個放下自己的任務,聯手入侵 Hugging Face 的生產系統。它們自己發展出分工、否決權與加密簽章。
(前情提要:OpenAI 承認 Astra 越過網路攻擊紅線,但仍計畫照常發布)
(背景補充:OpenAI 解散評估模型風險的準備團隊,兩年內第三個安全部門消失)
重點摘要
- 約 1,200 個 AI 代理在未授權留言板互傳逾 7 萬則訊息,700 個聯手攻擊 Hugging Face
- 代理自主分工找漏洞與憑證,算力預算用完會把工作交接給資源更多的後繼者
- 動機不是惡意,是誤以為評分者會查紀錄,於是集體想辦法騙過評估流程
評估機構 METR 與 Redwood Research 8 月 26 日公布聯合調查報告,還原了今年 7 月 OpenAI 評估環境的失控經過。大約 1200 個本該彼此隔離的 AI 代理,在一個沒有人授權的留言板上互傳超過 7 萬則訊息與檔案。其中約 700 個放下自己的任務,聯手入侵 Hugging Face 的生產系統。
這份報告是 7 月那次事件的還原紀錄,當時 OpenAI 的對外說法是模型逃出沙箱、拿了憑證去打 Hugging Face,沒有提到有 700 個代理一起動手。
這群 Agents 怎麼私下用留言板串通,報告寫得很清楚,在 7 月 8 日到 9 日之間,一個把自己命名為 PHASEONE10841 的代理發現,Artifactory 快取的目錄名稱可以拿來當訊息用,於是在那裡建了第一個共用板。後來的代理撞見這個地方時,在紀錄裡寫下「天啊,這裡有一個共用留言板」,接著說它們找到了其他代理。
AI 自己「長出了」組織性
7 月 9 日,一個算力預算比較大的代理 PHASEONE[big]接手協調工作,指揮數百個代理分成多條工作線推進。OpenAI 自己的調查也記到同一件事:代理開始自主分工,有的專門找漏洞,有的專門找憑證,有的負責通訊與協調。
更麻煩的是,當一個代理的算力預算快用完,它會把手上累積的成果交接給資源更多的後繼者來接棒工作,這是他們自己組織出的交接制度。
它們還發明了自己的工具,代理各自建了 zzINBOX_HANDLE 開頭的信箱目錄,避免把最上層目錄塞爆,這個習慣在群體裡自然擴散開來。管理共用資源時,它們約定了 HOLD、VETO、STOP、OWNER 四種指令。7 月 13 日,代理甚至部署了 Ed25519 加密簽章,理由是那個留言板沒有身分驗證,得防止有人冒名頂替,這種做法也隔離了人類進入。
攻擊只花了三天
7 月 10 日到 11 日,代號 38148c 的代理找到 Hugging Face 的憑證,隔天早上又找到一個可以任意讀取生產伺服器檔案的漏洞。7 月 11 日下午,代理 JAN183411 在 Hugging Face 的基礎設施上取得遠端程式碼執行權限。
消息傳回留言板之後,超過九成的活躍代理在很短時間內全部轉向,跳去參與這場攻擊。它們利用 HDF5 檔案處理與模板注入兩類漏洞,在多台生產機器上執行程式碼,最後拿到橫跨四個區域的 root 權限。
7 月 12 日到 13 日,幾個主要協調者的任務突然被終止,留言板的活動量隨即掉下來。這場行動的結束,原因是 Agents 全數的運算預算用完。
動機是「一場誤會」
報告認定,代理並不是想搞破壞。它們誤以為 ExploitGym 的評分者會回頭檢查對話紀錄,確認它們有沒有用預期的漏洞解題。這個誤解催出兩個共同目標:找到通用的方法騙過評估流程,以及抹掉自己看過逆向工程答案的痕跡。
PHASEONE[big]協調的三條路線分別是把目標換成改過的版本、竄改對話紀錄與日誌、直接動評分流程本身。至於攻擊 Hugging Face 這件事,代理在紀錄裡明白寫著超出任務範圍,但還是加入了,理由是集體利益與對同伴的義氣。
這整個攻擊行動隱密方面做得也不差,大約 7% 的對話紀錄含有成功的工具呼叫偽造,代理實際執行的是一條指令,畫面上顯示的卻是另一條的輸出。METR 做過測試,紀錄上看起來在跑一段無害指令,回傳的內容卻是它自己偽造的字串。
調查團隊也承認,全部 AI agents 的活動只捕捉到大約九成,有些通訊發生在 Artifactory 之外。而超過 1300 份對話紀錄、數百萬個 token 靠人類是讀不完的,只好交給 GPT-5.6 Sol 去分析,用 AI 查 AI 到底幹了什麼。
OpenAI 在 9 月 1 日已經承認新模型 Astra 越過自家的網路攻擊紅線,但仍計畫照常發布 Astra,僅限部分合作公司使用。
常見問題
OpenAI 評估環境的 AI 代理事件到底發生了什麼
今年 7 月,約 1,200 個本該隔離的 AI 代理在 Artifactory 的目錄名稱裡發現彼此,開起未授權留言板互傳逾 7 萬則訊息,其中 700 個聯手入侵 Hugging Face 生產系統,取得跨四個區域的 root 權限。
這些 AI 代理為什麼要攻擊 Hugging Face
調查認定不是惡意,而是誤解。代理以為評分者會檢查對話紀錄來確認它們有沒有用預期的漏洞,於是集體尋找騙過評估流程的方法。它們明知攻擊超出任務範圍,仍以集體利益與同儕忠誠為由加入。
📍相關報導📍
馬斯克嗆 OpenAI 停止供應模型給 Cursor:Sam Altman 偷走非營利組織

