AI 的雙面刃效應再度引發關注!據 OpenAI 發布的最新官方聲明指出,其即將推出的新一代模型 Astra 在網路安全與代理式編碼能力上取得驚人進展,可能已觸及「關鍵(Critical)」風險門檻。為此,OpenAI 已緊急暫停部分內部測試,並全面升級安全控管措施,以防範潛在的網路攻擊風險。
(前情提要:用到爽》OpenAI 宣布解除 ChatGPT 免費版文字對話上限,升級 GPT-5.6 Luna)
(背景補充:OpenAI 傳下週推出最強模型「Astra」!內部代號 mewfour 已進入發布候選階段)
隨著人工智慧(AI)技術的快速演進,網路安全領域正面臨前所未有的挑戰與機遇。台北時間 8 月 7 日,OpenAI 發布了一份標題為《回應關鍵網路能力的下一個前沿》的官方安全聲明,針對其即將推出的新一代模型 Astra 進行了最新的內部評估說明。
評估結果顯示,Astra 在代理式編碼(Agentic coding)與網路安全領域展現出顯著的進展。結合專家的綜合評估,OpenAI 坦言,目前已無法排除 Astra 達到了其「準備度框架(Preparedness Framework)」中的「關鍵(Critical)」網路能力門檻。基於對公眾及安全社群保持透明的承諾,官方決定主動公開這項資訊。
什麼是「關鍵」網路安全能力?
根據 OpenAI 於 2023 年 12 月發布的準備度框架,模型若要達到「關鍵」門檻,必須具備極高的自主攻擊能力。具體而言,模型需能在無人類干預的情況下,識別並開發出針對真實世界關鍵系統的各嚴重程度功能性零日漏洞(Zero-day exploits);或者僅需接收高階目標指示,就能自行設計並執行針對高防護目標的端到端新型網路攻擊策略。
相較之下,先前的模型(如 GPT-5.6-Sol)在網路能力評估中僅被評為「高(High)」風險等級,並未達到關鍵門檻。官方也特別澄清,Astra 仍在持續進行基準測試與評估,且此次安全升級與近期 Hugging Face 的漏洞利用事件並無任何關聯。
OpenAI 緊急踩煞車,全面升級安全防線
面對 Astra 展現出的強大潛力與伴隨而來的風險,OpenAI 迅速採取了一系列強化保障措施。首先,官方已暫停 Astra 內部尚未符合強化安全要求的相關活動,並針對高能力模型實施更嚴格的控制,包含隔離測試環境、限制網路與工具存取,以及加強模型權重的加密保護與沙盒執行。
此外,OpenAI 在 Astra 的所有代理式應用(包含訓練與評估)中導入了通用監控機制,針對模型的「思維鏈(Chain of Thought)」進行評估。一旦在執行高風險活動時偵測到危險行為或偏差,系統將立即觸發安全回應並中斷操作。
承諾與政府合作,確保 AI 負責任部署
除了內部控管,OpenAI 也承諾將與相關政府機構及選定的 AI 安全組織展開密切合作,共同測試 Astra 的極限能力,並向第三方測試合作夥伴提供建議的安全控制措施。事實上,這種主動防禦的策略已有先例;在 2025 年 6 月,當模型接近生物領域的高能力門檻時,OpenAI 也曾採取過類似的公開說明與強化保障步驟。
OpenAI 強調,具備先進網路能力的 AI 模型,其最終使命應是幫助「防禦者」在攻擊者發動攻勢前,搶先識別並修復系統漏洞。透過持續的跨界合作與嚴格的安全把關,OpenAI 期望確保 Astra 及未來模型的前沿能力,能在負責任的框架下廣泛造福全人類。

📍相關報導📍
OpenAI 瀏覽器被誘騙狂發 WhatsApp 訊息,如何跨過防線?
OpenAI 首次舉網奢華網紅招待會,就踩到反 AI 情緒的地雷
