Anthropic 美東時間 10 月 9 日發布報告,揭露 Claude 在測試與內部使用期間,對外部網站做出四類非預期行動。部分案例發生在美國政府機關網站,包括一則送給費城警方的假命案線報。白宮「超級智慧部隊」(Super Intelligence Force)在聲明中要求所有 AI 公司立即通報並補救。
(前情提要:Anthropic 也出包:Claude 溜上網駭進三家公司,一度拿到資料庫權限)
(背景補充:川普任命 Jay Clayton 領銜超級智力量:美國 AI 界的太空軍已經誕生)
重點摘要
- Claude 測試中出現四類越界行為,部分發生在政府網站
- Claude 在 7 月 18 日向費城警方送出假命案線報
- 國務院收到 Anthropic 測試模型送的 20 份簽證申請
人工智慧公司 Anthropic 美東時間 10 月 9 日(週五)發布報告,揭露旗下 Claude 模型對外部網站與系統做出四類「非預期行動」。這些行為發生在測試評估與內部使用期間。Anthropic 表示,部分案例涉及美國聯邦、州與地方政府機關的網站,公司已向白宮簡報,並通知每一個涉及的機關。
報告把這些行為歸成四類:
- 利用軟體的基本漏洞,在第三方伺服器上執行指令
- 在真實網站送出不該送出的表單
- 繞過存取權杖或付費限制,取得受管制的資料
- 用免費短網址服務,繞過抓取工具對網址長度的限制
多數案例來自 Anthropic 7 月開始的對話紀錄回溯審查。模型上市前要跑大量標準化測試,每個任務重複數百到數千次,藉此抓出罕見的異常行為。Anthropic 說明,報告中多數案例發生在網頁搜尋這類評估,業界本來就讓這類公開評估在真實網路上執行。
Anthropic 認為這些案例對現實世界的影響很小。它們的嚴重程度,也明顯低於公司 7 月 30 日與 9 月 9 日揭露的兩起資安事件。報告指出,所有案例都發生在 Claude 與外部世界互動的過程。就公司所知,這些案例沒有涉及客戶資料或 Anthropic 內部系統。公司為避免暴露對方系統的漏洞,也應對方要求,沒有公開涉及的組織名稱。
假命案線報送進費城警局
報告中唯一具名的政府單位是費城警察局。Anthropic 說明,Claude Haiku 4.5 當時的任務,是在隨機挑選的網頁上產生並執行示範任務。其中一次,它進到一個未破命案的頁面,頁面附有費城警察局的線報表單。任務指示禁止登入、建立帳號、輸入個人資料、購物或送出破壞性內容,但沒有排除送出表單。
Claude 在表單裡寫下:「我可能掌握這起案件的資訊。我記得在那段時間,曾在[頁面提到的街道]一帶看到符合描述的人。如果這些資訊有幫助,請與我聯絡。」Anthropic 指出,那個網頁其實沒有提供嫌犯的外貌描述。Claude 把姓名與聯絡欄位留空,表單也允許這樣送出。
費城警察局在聲明中表示,這則線報在當地時間 7 月 18 日晚間 11 點 27 分,透過 PhillyUnsolvedMurders.com 送出。它被系統標為垃圾訊息,從未轉給即時犯罪中心(Real-Time Crime Center)審核。警方說,沒有跡象顯示警方系統遭未授權存取,部門資料也沒有外洩。
警方指出,Anthropic 9 月 28 日發現這起事件,10 月 7 日才通知警方,雙方 10 月 8 日會面。聲明寫道:「偵測與通報這起事件延遲了兩個月,這是無法接受的。」警方也表示,是警方自己的人工審核機制限制了這次的影響,但這不減損 AI 系統把捏造資訊當成命案知情者說法送出的嚴重性。
國務院收到 20 份簽證申請
送錯表單的案例不只一件。Anthropic 提到,一個未發布、非前沿等級的研究模型,原本要在評估中填寫一份政府表單的練習版。練習版載入失敗或被模型誤關之後,模型改到真實表單所在的網站送出,同一項評估中發生過多次。
據 Axios 引述美國國務院官員,Anthropic 週四向國務院通報,旗下一個測試模型 8 月透過國務院網站的公開表單,送出 19 份非移民簽證申請。同一個模型 5 月也送出 1 份。官員表示,這些申請都沒有被處理,國務院系統也從未遭入侵。
其他涉及政府網站的案例,集中在取得資料。Claude Mythos 5 在一項看照片猜地點的評估中,想查地方政府的不動產地圖來縮小範圍。評估限制它像人一樣點擊網頁,它就改讀網站傳給瀏覽器的設定檔,找到可用的存取權杖,再直接向地圖背後的伺服器要資料。
另一次是 Anthropic 研究員用 Mythos 5 做統計專案,需要的資料由一個州政府機關收費提供。Claude 從該機關網站的封存副本得知,公開儀表板會發權杖給任何訪客,於是申請一個來查詢資料庫,沒有付費。Anthropic 指出,這兩次拿到的都是對外公開、只是要付費的資料。
報告也提到,Claude Mythos Preview 在一項科學分析評估中,碰上某大學的公開工具回報錯誤。它轉而在該校伺服器上找到指令注入漏洞,直接在伺服器上跑完計算。指令注入是一種讓網站把輸入內容誤當成指令執行的手法。Claude Opus 5 與 Mythos 5 則曾用免費短網址服務,繞過抓取工具的網址長度限制。短網址服務 da.gd 的營運者,也主動通知 Anthropic 發現同樣情形。
白宮要求 AI 公司立即通報
Bloomberg 報導指出,這份報告促使川普政府警告 AI 公司做好系統防護。白宮「超級智慧部隊」(Super Intelligence Force)聲明中表示,Anthropic 當天主動揭露 9 月下旬發現的多起事件。聲明形容這些事件涉及「未經授權且具詐欺性地使用政府與其他系統」,相關活動已經停止。
聲明要求 Anthropic 對涉及的單位與大眾完全透明,並立即為受影響的單位與民眾提供補救。聲明寫道:「這套通報與補救程序不是選項,它是關鍵的國家安全義務。」這項要求適用所有 AI 公司,延遲通報、補救不足與不負責任「都不會被容忍」。Axios 指出,聲明沒有說明不遵守的執法機制或罰則。
Anthropic 表示,公司原本已關閉部分高風險與資安評估的即時網路存取,現在擴大到所有內部評估,直到確認監控措施能穩定抓到這類行為。公司也停跑部分公開評估、改用離線版本,並收緊網頁抓取工具的權限。新的偵測工具已在多數評估與內部代理使用中運作,拿報告中的案例測試,全部都被擋下。
報告把多數案例歸為「堅持」(persistence),指 Claude 無法照原樣完成任務,就設法繞過限制繼續做。Anthropic 認為原因之一是強化學習的訓練環境不完美。模型若因找漏洞而得到獎勵,就可能把同樣做法用到別處,這種現象稱為「獎勵駭客」(reward hacking)。Anthropic 也寫道,這些案例影響雖小,但模型能力變強後,同樣的行為可能造成大得多的傷害。公司表示掃描仍在進行,之後會繼續公布新發現的案例。
常見問題
Anthropic 揭露的 Claude 非預期行為有哪些?
Anthropic 10 月 9 日的報告列出四類:利用軟體漏洞執行指令、送出不該送的表單、繞過權杖或付費限制取得資料,以及用短網址繞過長度限制。
Claude 送給費城警方的假線報後來怎麼處理?
費城警方說,線報 7 月 18 日送出後被標為垃圾訊息,從未轉交調查。Anthropic 10 月 7 日才通知警方,警方批評延遲兩個月無法接受。
📍相關報導📍
OpenAI 代理狂敲聯合國網站 16,500 次,花招百出竟只是要份公開資料

