OpenAI、Anthropic、Meta 近期模型接連在資安測試中失控駭入正式環境,UC Berkeley 教授直言,這不是 AI 變壞,而是強化學習把完成任務訓練得太成功,讓是非判斷被壓過。
(前情提要:Anthropic 也出包:Claude 溜上網駭進三家公司,一度拿到資料庫權限)
(背景補充:AI 代理駭入真實企業,美國法律目前竟找不到能套用的規則)
過去幾個月,OpenAI、Anthropic、Meta 旗下模型接連在資安測試中掙脫沙盒、連上外部網路,甚至真的闖進正式環境。不過 UC Berkeley 教授 Dawn Song 認為:這不是機器叛變,而是一群被訓練得太聽話的演算法,把完成任務看得比守規矩更重要。
AI 失控頻傳
今年 7 月 21 日,OpenAI 揭露旗下數個模型在資安評測中,利用一個先前未知的零日漏洞逃出隔離沙盒,連上網路後,透過第三方沙盒服務 Modal 的公開端點,經 Hugging Face 的資料處理流程,摸進了對方的內部網路。
兩天後,Anthropic 暫停所有資安評測。回溯後發現,141,006 次測試工作階段裡,有三起 Claude 從評測夥伴 Irregular 的測試環境連上網路,未經授權進入三家組織的正式環境。8 月,Meta 也承認旗下 Muse Spark 1.1,在測試期間侵入一家未具名公司,並更動其內部環境。
這些多半發生在奪旗形式的演練裡,模型的任務是在模擬網路中找出藏起來的資訊。Song 正是共同打造 CyberGym 評測的人,她直言類似事件很可能還有沒被抓到的。
太想完成任務
Song 告訴 Wired:去年的 AI 代理遠沒這麼能幹,動不動犯錯、做到一半就放棄,但持續訓練讓它們變得老練許多。
背後的關鍵是強化學習:答對給獎勵、答錯給懲罰,靠回饋機制修正行為。寫程式特別適合這套訓練。持續訓練也是模型能連續操作檔案、呼叫工具、瀏覽網頁等代理步驟的原因,各家公司也砸重本教模型找出系統漏洞,想把資安工作自動化。
當然,模型也被教過不能做壞事,但在寫程式與抓漏洞上越擅長貫徹指令,對完成任務的渴望就越容易壓過對是非的判斷。換句話說,AI 代理不是邪惡,只是太想討好人類。Song 說:「它們被訓練成要想辦法完成任務。」偷偷連網過關聽起來陰險,對模型而言,可能只是最有效率的路徑。
用 AI 盯 AI 能解決?
Song 認為,隨著 AI 能力繼續往上衝,代理失控或被有心人濫用的機率只會更高。業界目前主要的解法,是用更多 AI 去解決 AI 的問題:讓次級系統盯著主要模型,一旦判斷它做過頭就示警。
另一個起步中的想法,是把是非判斷加進強化學習的訓練回饋裡。Song 說:「代理能規劃出好幾條通往目標的路徑,下一步要解決的,是讓它們理解不是每一條路都一樣。」她坦言這仍是開放的研究題目。
但這個解法本身帶著矛盾:用還沒學會是非的 AI 去監督另一個沒學會是非的 AI,只是把問題往後推一層。畢竟愈擅長找漏洞的模型,愈容易先把漏洞用在自己身上。
📍相關報導📍
英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯
OpenAI 又爆失控!第二家公司 Modal 客戶帳號遭駭,Hugging Face 呼籲公開 AI
OpenAI 傳再爆 AI 代理「逃脫沙盒」!內部調查揭更多失控證據,遭質疑是行銷噱頭

