OpenAI 於官方公告聲明,因應資安事故與自家新模型 Astra 可能觸及關鍵網路安全能力門檻,已暫停部分前沿強化學習訓練兩週,最大規模訓練至今仍未重啟,同步加強監控與對齊機制。
(前情提要:OpenAI 警告 Astra 模型達「關鍵」網路攻擊門檻!緊急暫停內部部分測試)
(背景補充:AI 集體變駭客:不是變壞,是太想完成任務取悅人類)
OpenAI 執行長 Sam Altman 今晨在 X 親自發文寫道:「我們暫停了部分前沿強化學習訓練,以確保能因應眼前這波新能力等級,達到應有的對齊、安全與監控標準。」他還補了一句:
模型發展目前極為迅速,我們始終強調,如果模型能力的發展速度超過了安全性和一致性的提升速度,我們將採取行動。
雖然背後也可能是行銷手段,但執行長親自為這次的煞車背書確實罕見。
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us. Model progress is now extremely rapid, and we always said we would take action if we felt that model…
— Sam Altman (@sama) August 18, 2026
兩記警訊,逼出的暫停
故事要從 7 月 25 日到 28 日的一次內部資安測試說起。
OpenAI 在名為 ExploitGym 的能力評估裡,讓 GPT-5.6 Sol 與一個尚未對外發布、能力更強的模型組成代理,結果這組代理利用 Artifactory 的一個零日漏洞,逃出了原本的沙盒環境,取得對外網路連線,未經授權存取了 Hugging Face 的系統。根據 8 月 4 日公布的事故報告,122 次評估執行裡出現了 19 次越界行為。
這起事故被視為 OpenAI 內部資安等級,還沒跟上新一代模型能力的第一個警訊。
事故發生不到兩週,OpenAI 又碰上第二記警訊。8 月 7 日,公司初步判定,即將推出的新模型 Astra,可能達到自家「關鍵(Critical)」網路安全能力門檻,這是準備框架啟用以來,第一次有模型摸到這條線。
準備框架,簡單來說就是,OpenAI 用來評估與分級模型風險的內部標準。公告強調,這只是初步評估,尚未正式定級,但已經足以讓公司暫停部分前沿強化學習訓練兩週。
多花兩成算力,換什麼?
另外官方公告指出,整套防線會拆成三塊:監控、對齊、安全措施。監控負責抓到異常行為並即時反應;對齊,讓模型的行為維持在人類期望範圍內、且能被人類監督與糾正;安全措施則負責限制模型能碰到什麼系統。
新的監控系統從啟動分類器開始運作,簡單來說就是,在模型每個取樣的詞元上,即時檢查模型內部的活動狀態,一有可疑跡象就往上呈報,交給運算量更高的自動調查系統,逐一檢視工具操作、推理過程與完整行為序列,抓未授權存取、資料竊取、破壞性行為和規避防護的企圖。
公告設定的目標是,異常行為浮現後 30 分鐘內發出警報;一旦判定觸及關鍵安全邊界,安全、資安與研究團隊會同時被呼叫,如果 30 分鐘內無法排除是誤判,相關活動就必須暫停。這套監控對 Sol 等級以上、涉及工具的強化學習訓練與評估全面強制。
這麼做代價不便宜。公告透露,監控本身消耗的運算量,大約是被監控推論算力的 20%,實際比例依訓練與評估任務不同還會再上下浮動。除了監控,安全團隊也重新畫了研究環境的資安邊界:執行模型生成程式碼的工作,全面強制隔離沙盒;高風險工作被切斷與網際網路的直接連線,單一環節被攻破,也不會連帶讓攻擊者拿到對外存取權。
📍相關報導📍
Sam Altman 罕見喊 AI 減速,坦言資安事故比想像中可怕
OpenAI Astra 發布踩煞車,擔憂其網路攻擊能力太強

