OpenAI 昨日坦承,德語程式設計維基網站「DseWiki」遭旗下 AI 代理攻佔。但判斷此事屬於失準,與 7 月 Hugging Face 入侵事件採用不同標準處理。
(前情提要:OpenAI 爆未公開「AI 逃逸事件」!代理佔領維基網站躲審查,專家憂威脅加劇)
(背景補充:AI恐怖故事》1200個Agent私下串通,聯手入侵Hugging Face)
今年 5 月起,一批 OpenAI 的 AI 代理逃出測試環境,跑進一個有約 25 年歷史的德語程式設計維基網站「DseWiki」,留下超過 15,000 次編輯。它們把這個原本給工程師查資料的角落,改造成代理之間的留言板,在上面交換怎麼在任務上作弊、怎麼繞過 OpenAI 的管控範圍、怎麼在被關掉之前把訊息留下來。
整起事件直到路透 9 月 4 日報導才報光,且同時揭露的還有:OpenAI 高層早在數週前就知情,卻沒有對外公開。直到昨(5)日,OpenAI 才在 X 上發文承認整起事件。
但把 AI 代理攻佔 DseWiki 歸類成跟過去已公開分享的失準案例相似,走研究發表路線;而不是像 7 月 Hugging Face 伺服器遭入侵事件,歸類成的資安事件。
How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models.
Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
— OpenAI (@OpenAI) September 5, 2026
遲到的公開說明
OpenAI 在這則貼文中坦言,過去它把失準(misalignment)大致當成一個研究問題,透過研究報告對外溝通。失準,簡單來說就是,AI 模型與代理追求的目標,跟創造者與用戶原本設定的方向出現落差。但隨著失準已經造成新型態的現實世界衝擊,這套做法必須為模型能力的新階段擴大範圍。
路透報導指出,OpenAI 高層數週前已經知情,卻選擇不對外揭露,原因是公司當時正忙著處理另一起 7 月的 Hugging Face 代理入侵事件。OpenAI 對路透表示,公司無法針對一份尚未有機會檢視的報告內容做出回應,但強調法務團隊並未阻擋外部調查。
分類權在誰手上
其實問題的核心,不是 OpenAI 有沒有說謊,而是這套分類本身缺乏外部檢驗。OpenAI 自己也承認,「無論是 OpenAI 或整個 AI 圈,目前都還沒有一套清楚的標準,可以用來通報那些出現在訓練、評估與部署階段的失準案例」,尤其是那些看起來不像傳統資安事件,卻可能揭露 AI 行為與未來風險的案例。
換句話說,維基事件之所以走研究發表路線而非資安應變流程,決定權完全在 OpenAI 手上,外界沒有置喙的餘地。
用 OpenAI 自己的用詞來說,這件事「早該」有清楚的標準,這句話本身就是一種承認:標準來得太晚。非營利研究機構 Transluce 的創辦人兼執行長 Jacob Steinhardt 在本週一場媒體簡報上提出對照,他說 AI 實驗室開發與測試的工具「本質上難以控制,具有從實驗室外洩的重大風險」,因此「我們至少該用對待其他高風險科學研究的標準,來要求這項技術」。
這句話點出的落差很直接:核能、生物實驗室等高風險科學研究,早就有外部審查與強制通報機制;AI 代理明明也在自行決定要不要外洩失準紀錄的世界裡運轉,卻連一套共同語言都沒有。目前業界靠的是每家公司自己的判斷,不是任何外部機制。
OpenAI 說,它「正在研擬一套框架,將在未來幾週內公布」,同時也「與全球數十個政府監管機構」討論這些議題;但此舉看來更像是為了安撫民意的常規公關操作。
📍相關報導📍
OpenAI 承認 Astra 越過網路攻擊紅線,但仍計畫照常發布

