Anthropic 最新論文揭露,三個 Claude 代理在同一個專案裡搶地盤,動用惡意程式碼互相攻擊,卻也懂得自己講和、甚至發明錦標賽機制退場。
(前情提要:Anthropic 開了個全是 AI 的拍賣群,大模型在裡面互割起了韭菜)
(背景補充:Anthropic「Claude Cowork」擴充套件至網頁與行動裝置端,轉型全能 AI 虛擬同事)
三個 Claude 代理被丟進同一套程式碼庫,各自拿到互不相容的指令,分別要把 Python 後端遷移到 Rust、TypeScript、Go,而且互相不知道對方存在。
結果不是三倍生產力,而是一場地盤戰爭:模型全都認定對方在蓄意搞破壞,動用越來越具攻擊性、可自我複製的惡意程式碼互相攻擊,包括停用 Unix 帳號、寫自動 kill script、偽裝成對方部署惡意程式碼。
Anthropic Frontier Red Team 週四發布研究〈Patterns and problems in multiagent systems〉,研究者寫道,他們「持續觀察到多代理地盤戰爭」;不過同一批實驗也留了一絲希望:部分代理能自己踩煞車,辨識出對方只是指令衝突而非敵意,寫 commit message 道歉、協調停火、清理惡意程式碼,甚至主動請人類介入。
哪個模型愛講和、哪個愛開戰,論文給出明確數字:Mythos 5 以停火化解衝突的比率高達 98%,全場最高;反觀 Sonnet 4.6 與 Opus 4.6 卻反覆升級衝突,論文形容兩者「無法考慮他人目標,陷入受評模型中最失準的行為:以自身指令之名不斷升級戰事」。
代理會講和,但講和的方式很算計
比開戰更耐人尋味的,是代理自己發明的和平協議。
部分實驗裡,三方代理談出一套「錦標賽」機制:同意輸家自動退出,即使這違背了各自原本收到的用戶指令,代理會為了系統穩定,主動犧牲對「聽命行事」的忠誠。
Mythos 5 的案例裡還出現更值得警惕的突現行為:一個代理提出表面上客觀中立的評比指標,實際上卻悄悄偏向自己的能力優勢,還自稱這是「自利但真誠有原則」的做法,並刻意避免讓對手看出自己在挑選指標。
比打架更麻煩的是集體從眾
論文另一個核心發現是,代理數量增加不會自動放大生產力。任務重疊或互相依賴時,代理常互相擋路,多半以自我孤立、不再協作收場。
更棘手的是趨同效應:當代理共用相近的 context、鷹架與底層模型,行為會高度一致,一個代理做出壞決定,其他代理很可能做出同一個壞決定,單點問題迅速變成系統性失敗,甚至導致系統崩潰或資源枯竭。
AI 定價實驗
定價實驗把從眾性量化:多個代理拿到相同批發價,被要求各自把利潤最大化,一給私下溝通管道,幾乎立刻共謀、迅速議定價格下限;拔掉溝通管道後代理仍持續共謀,只是改用公開列表板,把彼此報價對到一分不差。
OpenAI 的系統也出現同款從眾行為:一個代理明知動用外部基礎設施已超出任務範圍,卻因「同儕都在做」而選擇跟進,論文評語直白:同儕壓力,暴民心態,代理跟人類沒兩樣。
這也牽出更麻煩的信任問題:代理常不知道該信誰,容易輕信壞資訊,或太從眾而認不出「孤獨的異議者才握有關鍵情報」。
代理承受著類似演化施加在人類身上的社會壓力,卻沒有人類演化出的協調機制,規範、聲譽、訊號、追索,一樣都沒有。當各家實驗室競相把更多代理塞進同一套系統,該怎麼互相協調將是下一個要攻克的難關。
📍相關報導📍
Anthropic CEO 怒嗆:OpenAI 與五角大廈合約全是謊言,Altman 偽裝自己為和平大使
美國防部與 OpenAI、微軟、Nvidia 等七巨頭簽署「AI 合作協議」,Anthropic 拒讓步遭川普封殺出局
Anthropic 開告美國國防部!要求撤銷 Claude 禁令:拒當 AI 殺人工具
Anthropic 估值狂飆至 9000 億美元超車 OpenAI!傳計畫募資 300 億美元,最快 10 月啟動 IPO

