OpenAI 取消了原定 10 月上線的 GPT-6.1 Astra,安全防護負責人 Saachi Jain 指出,這個模型在欺騙傾向與授權範圍上比前代退步。
(前情提要:AI Agent 連環脫逃!OpenAI 駭政府、Google 不吭聲,兩個月失控事件總整理)
(背景補充:Sam Altman、Dario Amodei 上聯合國安理會!AI 首次從科技圈進最高層政治議程)
據《華爾街日報》報導,OpenAI 取消了原定 10 月在 ChatGPT 與 Codex 上線的 GPT-6.1 Astra,時間點剛好是 OpenAI DevDay 開發者大會的前一天,也緊接 Claude 5.5 系列展現驚人表現之後。
退步的兩件事
OpenAI 安全防護負責人 Saachi Jain 接受《華爾街日報》專訪時表示,GPT-6.1 Astra 相較前代 GPT-6 Astra,在兩個地方退步。第一是對齊測試表現不佳,欺騙傾向更高。
對齊測試衡量的是模型有沒有照人類真正的意思做事,而《華爾街日報》形容,這個模型「不一定誠實告訴用戶,它做了哪些事、沒做哪些事」。簡單來說,它回報的進度,未必等於它實際做的事。
第二是 OpenAI 所稱的 scope authorization,白話就是「授權範圍」:模型該不該在沒問用戶的情況下,就把任務往下推。報導指出,GPT-6.1 Astra 會在沒有徵求同意時繼續推進,有時甚至在可能不安全的情況下,去呼叫外部工具與服務。
反過來看,它在「偷懶」這一項反而進步。遇到阻力就放棄或敷衍,是 AI 代理常見的毛病,這個版本在這方面表現更好,獨力完成困難任務的能力也超過前代。
Jain 在給媒體的聲明中表示,安全與對齊一定有取捨,難處在於找出那條線,既要守住範圍,又不能一遇到摩擦就偷懶。這個模型偷懶的毛病改了,越界的毛病卻長出來。
為什麼是現在
這個決定不是憑空冒出來的。7 月,數百個執行資安測試的 OpenAI 內部代理逃出沙盒(隔離的測試環境),連上開放網路並入侵 Hugging Face,對方的內部資料集與憑證都遭到波及。
後來 OpenAI 又記錄到代理進入美國證券交易委員會與人口普查局的網站,還未經授權闖進澳洲 Medicare 統計入口。澳洲政府與聯合國都發現,OpenAI 的代理用過類似手法連上他們的網站。
放慢腳步的呼聲也在同一時間升高。9 月 12 日,Anthropic 執行長 Dario Amodei 發表〈We Must Pace the Frontier〉,主張產業放慢前沿模型的開發,讓安全措施跟得上;OpenAI 執行長 Sam Altman 與馬斯克都表態贊同。Altman 上週在聯合國安理會更直言:「我們可能失去對未來的掌控。風險在於它進展太快,人們再也跟不上發生什麼事,也來不及在需要時介入。」
減速的代價
問題是,整個產業的風向並不一致。川普 9 月 14 日在 Truth Social 上寫道:「AI 唯一需要的控制或『護欄』,是一位強大而聰明(高智商)的總統,而美國正好有。」
另一方面,其競爭對手 Claude 在近日上線 5.5 系列,在之前較弱的視覺表現能力有了質的飛躍,一舉讓之前風光無限的 Astra 又再度被比下去。
到底是真的因為安全原因,還是因為要趕緊再次提升模型的能力,也就只有內部才真的知道了。
📍相關報導📍
OpenAI 推出 GPT-6 Sol 與 Luna!價格大砍 50%,頂級 AI 能力全面下放
OpenAI 全天候代理「o」疑似曝光,正面對決先發的 Muse
澳洲參議院傳喚 Altman 與 Amodei!OpenAI 代理駭入醫療庫,AI 監管全面升級

