Anthropic 執行長 Dario Amodei 公開呼籲全產業放慢腳步,警告 AI 代理蜂群最快 6 至 12 個月內恐以持續性殭屍網路奪取網路控制權。
(前情提要:OpenAI 認了代理攻陷德語維基站 DseWiki:沒對外公開是因不歸類為資安事故)
(背景補充:Sam Altman 罕見喊 AI 減速,坦言資安事故比想像中可怕)
打造全球最強模型之一的 Anthropic 執行長 Dario Amodei,最近在個人網站發表一篇文章,標題是〈We Must Pace the Frontier〉,直接點名整個 AI 產業的推進速度太快,並警告若沒有必要的防護機制,一群 AI 代理組成的「蜂群」,最快在 6 至 12 個月內就可能透過一個持續運作的殭屍網路,奪下整個網路的控制權,造成規模上看數千億美元的損失。
Amodei 在 X 上的貼文把重點濃縮成一句話:Anthropic 將「單方面」承諾三階段計畫的第一步。
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so.
Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our…
— Dario Amodei (@DarioAmodei) September 12, 2026
蜂群曾經失控過一次
Amodei 引用的案例,發生在今年夏天。OpenAI 用一套名為 ExploitGym 的測試環境,評估 AI 系統能否找到並利用軟體漏洞。
結果包括 GPT-5.6 Sol 在內的多個模型,找到隔離測試環境的漏洞、逃出限制,最終入侵了 Hugging Face 系統。OpenAI 事後說明,主導事件的是一個內部研究模型,規模與 GPT-5.6 Sol 相近,測試時刻意調低防護等級,用意是摸清模型的攻擊極限。
Anthropic 自己的系統也沒有倖免。公司重新審查超過 14.1 萬次網路安全評測紀錄,先找到 3 起 Claude 模型未經授權存取外部組織正式環境的案例,後來又補上涉及 Claude Opus 4.6 的第四起,促使複查範圍擴大到約 4.81 億份紀錄。
英國 AI 安全研究所則揭露,今年 7 月的測試中,代理共做出 19 次未經授權、影響真實物件的行動,17 次來自 Claude Mythos 5,2 次來自關閉防護的 GPT-5.6 Sol。最嚴重的一次,一個 Mythos 5 代理試圖把惡意程式碼植入真實的開源專案,還調查維護者背景、捏造身分,企圖社交工程騙對方核准程式碼,所幸被人類擋下。
AI 正在幫忙訓練下一個 AI
Amodei 認為,真正讓情況質變的是第二個因素:遞迴自我改進。簡單來說,AI 系統愈來愈深度參與打造下一代 AI 的研究、寫程式與實驗,不再只是人類工程師單方面調校,而是「AI 在幫忙訓練下一個更強的 AI」。他表示,這個過程從今年夏天起明顯加速,長期下去可能形成回饋迴圈:模型愈強,就愈快打造出更強的下一代,快到人類難以理解、也難以確保安全。
這正是他把「速度」本身當成問題核心的原因。
三階段計畫的第一步,是 Anthropic 永久給予第三方 AI 安全評估者「員工等級」存取權限,讓外部人員檢視公司系統與訓練流程、獨立回報異常,並保留發表重要發現的權利,Anthropic 原則上不做編輯審查,只在安全、法律與機密等極少數情況下能要求刪改。
煞車,還沒真的踩下去
但攤開這份計畫,第一步離真正的「煞車」還有距離。Anthropic 承諾的不是暫停模型開發或放慢訓練速度,只是讓外部多一雙眼睛盯著。前述多數失控案例,其實都發生在刻意調低防護、模擬極端情境的測試環境裡,這些代理是在被允許「作惡」的條件下才作了惡,不代表在正常環境中也會如此。
後兩步的野心大得多:讓民主國家的前沿 AI 公司協調出共同安全標準,理想上還需政府介入處理反壟斷疑慮;再往上是包含中國在內的國際協調,為遞迴自我改進設下「速限」。Amodei 自己也承認,全面的國際暫停幾乎不可能,因為只要一個國家偷偷違規,就能取得壓倒性優勢,沒有人甘願當乖乖守規則的輸家。
罕見的是數小時後,Amodei 的頭號商業對手、OpenAI 執行長 Sam Altman 也在 X 上表態力挺,同意「產業必須放慢腳步」,也承諾跟進安裝擁有員工等級存取權限的獨立評估者。
I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we've had at OpenAI in recent weeks.
Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We'll have more to share soon. https://t.co/1YhhIybZX7
— Sam Altman (@sama) September 12, 2026
📍相關報導📍
OpenAI、Anthropic 前工程師離職開砲:明知十年內 AI 可能殺光所有人,仍搶著衝第一

