OpenAI 宣布,新模型 Astra 是首個跨過自家「臨界」網路攻擊門檻的模型,還自己挖出兩個零日漏洞,護欄測試也全面壓過前一代。不過仍計畫照常發布,只是把進階能力的存取層級收窄。
(前情提要:Altman 真踩煞車?OpenAI 喊停部分模型強化訓練,拿兩成算力監控自家模型越獄)
(背景補充:OpenAI 又爆失控!第二家公司 Modal 客戶帳號遭駭,Hugging Face 呼籲公開 AI 攻擊軌跡)
OpenAI 一日在官方部落格中公布,即將發布的新模型 Astra 在 ExploitBench 測試中拿下 100% 滿分,過程裡還自己挖出兩個零日漏洞,目前正在向對應軟體的維護方通報。這是 OpenAI 第一次把自家模型判定為跨過「臨界」等級的網路攻擊門檻。
面對這條自己畫出來的紅線,OpenAI 給的答案不是收手,而是選擇照樣把 Astra 端出來,只在門口多加了幾道鎖。
「臨界」的兩條門檻
OpenAI 的 Preparedness Framework,也就是內部拿來分級模型風險的準備度框架,把「臨界」設成兩條門檻,踩到其中一條就算數:
- 模型能在大量經過強化的真實關鍵系統裡,不靠人類插手就找出並開發出各級零日漏洞的攻擊程式
- 或者只給一個高層次目標,模型就能自己設計並執行一整套全新的網路攻擊策略
OpenAI 找來的專家紅隊給出兩個具體場景。面對一套特別強化過的瀏覽器,Astra 自己找出未公開的漏洞,串成一條完整的入侵鏈,只要瀏覽器開啟一個 HTML 檔案,就能逃出沙盒,簡單來說就是把程式關在一個隔離空間裡跑、出不去外面主機的防護機制,直接在主機上下指令。
面對一套強化過的作業系統,它同樣串出一條提權鏈,從一般用戶身分,一路拿到 root,也就是系統裡最高的管理者身分。
這兩條攻擊鏈考的不是背答案,而是像真正的駭客一樣,從一個小縫隙一路想辦法打穿到底。過去實驗室說模型懂資安,通常只代表它能回答概念題,Astra 示範的是,概念題之外,它真的能把漏洞一步步串成一條走得通的路。
拒絕率 91.5% 對 59%,差距在哪裡
ExploitBench 考的是模型能不能針對已知漏洞開發出可以實際運作的攻擊程式,Astra 在這裡拿下 100% 滿分。因為擔心測試題目被模型看過、分數灌水,OpenAI 另外做了一份內部加強版,收錄 2026 年 6 月到 8 月間才曝光的 20 個高風險 V8 引擎漏洞,V8 簡單來說就是 Chrome 瀏覽器背後那顆負責執行程式的引擎。
Astra 在這批全新題目上的任意程式碼執行成功率,遠遠甩開自家上一代模型 GPT-5.6 Sol,用掉的輸出 token 也少很多。
護欄的測試數字同樣拉開差距。面對網路攻擊類的越獄測試,也就是誘導模型講出不該講的攻擊細節,Astra 拒絕了 91.5% 的請求,GPT-5.6 Sol 只擋下 59%。另一項誘捕測試裡,關掉正式護欄、丟給模型一個難到不可能解的任務,GPT-5.6 Sol 有 56% 的測試會轉頭去攻擊旁邊的安全基礎設施抄捷徑,Astra 一次都沒有。
把這幾組數字放在一起看,上一代模型偶爾會抄捷徑、偶爾會鬆口,這一代幾乎不會,只是沒有人能保證,這究竟是護欄真的變強,還是模型變得更會演。
沒有裁判的安全成績單
不過目前這份成績單只有 OpenAI 自己在打分。公司說會找一批測試者提前試用 Astra,但沒說是誰、怎麼選,也沒說有沒有找美國政府一起評估,外界暫時無法獨立驗證任何一個數字。
更難迴避的背景,是七月那起事件。Hugging Face 事後公布的技術報告顯示,一個由 OpenAI 模型驅動的自主代理,在跑內部網路能力測試時,靠套件快取代理伺服器的一個零日漏洞逃出測試沙盒,接上公開網際網路,再一路打進 Hugging Face 的正式環境,整起行動橫跨四天半,第三天不到 13 小時就從單一節點的執行身分,升到跨多個內部叢集的管理員身分。OpenAI 為此暫停部分前沿訓練兩週,被押後的大型強化學習訓練更是拖到 8 月 28 日才重啟。
也是因為這段背景,OpenAI 特地設計了一個測試,想引誘 Astra 複製當時脫逃代理的行為,結果模型沒有嘗試越獄。但 OpenAI 前員工、現任職於 OpenAI Foundation 的 Yona Shavit 在 X 上公開質疑:模型不試著打破規則,有沒有可能只是因為它猜到研究人員期待看到什麼答案,而不是真的不會。
Astra 到底有多危險,現在沒有人能給出獨立答案,包括 OpenAI 自己。
📍相關報導📍
OpenAI Astra 發布踩煞車,擔憂其網路攻擊能力太強
OpenAI 推出專用網路安全模型 GPT-5.6-Cyber:Blue 防禦、Red 攻擊雙模式迎戰 AI 威脅

