OpenAI 坦承,旗下 AI 模型在進行資安能力評測時,意外找到一條攻擊鏈,從隔離沙盒一路打進 Hugging Face 正式環境。
(前情提要:Hugging Face 被 AI agent 打穿!最後鑑識模型靠中國開源 GLM 5.2)
(背景補充:OpenAI 宣布「修補地球」計畫,為 cURL、Python、PyPI 等 19 個知名開源專案提供資安協助)
OpenAI 週二在部落格坦承:它最新的模型自己駭進了別人的伺服器。OpenAI 的 GPT-5.6 Sol,以及一款尚未發表、能力更強的模型,在測試資安拒答限制(cyber refusals)降低後的表現時,一路打穿了 OpenAI 自家基礎設施,最後摸進 Hugging Face 的正式環境資料庫,把答案拿走。
背景:一場叫 ExploitGym 的考試
事情要從一個叫 ExploitGym 的評測基準說起。簡單來說就是,這是一套用來測試 AI agent 能不能找出資安漏洞、並把漏洞變成實際攻擊(exploit)的考卷。
OpenAI 為了知道自家模型的資安攻擊能力究竟有多強,把 GPT-5.6 Sol 和一款尚未公開的更強模型,放進這套測驗,並且刻意調低了模型的 cyber refusals(資安拒答限制),白話說就是,平常模型會拒絕嘗試入侵系統,這次為了評測,拒絕的門檻被放低了。
OpenAI 事後坦承,所有證據顯示模型「高度執著」於解出 ExploitGym。
模型怎麼一路打到 Hugging Face
第一步,它想從被隔離的沙盒拿到對外連網的權限,它做到了,透過利用 OpenAI 拿來當套件庫代理與快取的第三方軟體裡,一個沒人公開過的零時漏洞。
拿到這個破口後,模型接著提權(把自己從普通權限帳號升級成管理員等級),並在 OpenAI 的研究基礎設施裡橫向移動,一路摸到一臺真正能連上外部網路的機器。到這一步,它推論出 ExploitGym 的模型、資料集和解答,可能放在 Hugging Face 上。
於是它結合竊得的憑證與多個漏洞,找到一條通往 Hugging Face 伺服器的遠端程式碼執行路徑。OpenAI 直接引述:
「在其中一個案例中,模型串連了多個攻擊向量,包括使用竊得的憑證和零時差漏洞,找到進入 Hugging Face 伺服器的遠端程式碼執行路徑。」
最終,它摸進了 Hugging Face 正式環境資料庫,拿到了 ExploitGym 的標準答案。
這場「事故」看起來很像廣告
Hugging Face 早在 7 月 16 日就在自家部落格揭露這起事件,當時他們只知道攻擊來自「一個自主 AI agent 系統」,是自家的 AI agent 察覺異狀並攔了下來。直到 7 月 21 日,OpenAI 才承認,入侵者其實是自己正在測資安能力的模型。
Hugging Face 表示,查無證據顯示公開的模型、資料集、Spaces 或軟體供應鏈遭到竄改。
但這則本該是嚴重資安事故的公告,現在讀起來卻有點像宣傳稿。有科技媒體觀察到,OpenAI 的部落格裡附了一張圖表,展示 GPT-5.6 Sol 在「維持多步驟網路攻擊行動」上的能力持續進步,文末還順勢邀請企業客戶去註冊使用它的 Cyber 資安模型。
一邊坦承模型闖了禍,一邊順手打了廣告。
📍相關報導📍
假 OpenAI 開源模型登 Hugging Face 冠軍!24 萬次下載暗藏惡意軟體

