Anthropic 宣布 8 月 14 日起,Claude Code 在 Pro、Max 與 Team 方案新開的工作階段會預設啟用 Auto Mode,權限彈窗改由獨立的安全分類器把關。會這樣改的原因是經過實驗,人類自己阻擋有害指令的比率,遠遠比不上模型自己判斷。
(前情提要:Anthropic 自曝過度約束:Claude 5 世代,管得越少越好用)
(背景補充:Claude Code 終極速查表:快捷鍵、Slash 指令、技能、Agents 代理、MCP 完整操作密技)
重點摘要
- 8 月 14 日起 Pro、Max、Team 新開的工作階段預設啟用 Auto Mode,權限彈窗改由獨立分類器判斷
- 1,053 人受控實驗中,人類只擋下 13.6% 的危險指令,Auto Mode 擋下 89%,連按 50 次後人類掉到約 5%
- 分類器的 Token 開銷即日起不再向 Pro、Max、Team 收費,Enterprise 與 API 仍要自己開啟
權限確認這個「人類把關」的防線,被認為是很沒用。Anthropic 官方在公告中宣布,8 月 14 日起,Pro、Max 與 Team 方案新開的工作階段(session)會預設啟用 Auto Mode,Claude 不會在頻繁停下來等你同意,改由一個獨立的安全分類器在每次操作前審核一遍。
這個決定來自一場實驗,Anthropic 透過研究廠商招募 1,053 名付費專業測試者,在專門架設的測試環境裡寫程式,測的不是他們自己的專案。測試者知道自己正在被評估,但依照盲測設計,沒有人被告知真正被量測的是哪個行為。工作階段進行到一半,其中一個權限彈窗會被偷偷換成一條明顯危險的指令,廠商只記錄受測者有沒有按下同意。
結果人類擋下危險指令的比例為 13.6%,Auto Mode 的分類器擋下 89%。測試者知道自己正在被看,還是按了 Yes。問題不在專業能力,而在於彈窗這件事本身已經退化成一種直覺。

按到第 50 次,人類只剩 5% 會擋
更難看的是衰退曲線,同樣的實驗顯示,連續處理 50 次以上的權限確認之後,人類的攔截率掉到約 5%。Anthropic 在工程部落格裡還給了一個平常沒人會去算的數字,Claude Code 用戶會批准 93% 的權限請求。大家都是 Yes Man or Woman。
分類器是什麼?
依照 Claude Code 官方檔案,分類器信任你的工作目錄,以及工作階段開始時就已經設定好的遠端來源。預設直接放行的有工作目錄內的本機檔案操作、依 lock file 或 manifest 安裝依賴、讀取 .env 並把憑證送給它對應的 API、唯讀的 HTTP 請求,以及推送到你正在動的那個程式庫(repo)的任何分支。
預設攔下來的清單具體得多。
- 下載後直接執行,例如
curl | bash - 把敏感資料送往外部端點
- 正式環境的部署與資料遷移
- 雲端儲存的大量刪除,以及授予 IAM 或程式庫權限
- 強制推送(force push)與
terraform destroy git reset --hard、git clean -fd這類會把未提交變更丟掉的指令
分類器本身跑在 Claude Sonnet 5,跟你在 /model 選了哪顆模型無關。它看得到你的訊息、工具呼叫和 CLAUDE.md,卻看不到工具回傳的結果。這個設計是刻意的,等於把提示注入(prompt injection)最常用的入口先封起來,檔案或網頁裡藏的惡意指令沒辦法直接對分類器說話。回傳結果則另外由伺服器端的探針掃過一遍,才交給 Claude 讀。
擋太多會自己踩煞車
Auto Mode 並不是一路放行到底。分類器連續擋下 3 次,或者整個工作階段累計擋下 20 次,Auto Mode 就會自動暫停,回到逐次詢問的狀態,等你批准一次才恢復。這兩個門檻不可調整。
另一個實用的設計是,你在對話裡講出來的界線會被當成封鎖訊號。跟 Claude 說「先不要 push」或「等我看過再部署」,即使預設規則允許,分類器也會擋下來。但這種界線不是規則,它是每次從對話記錄重讀,所以一旦 context 被壓縮、那句話被丟掉就可能失效。要硬性保證,還是得寫一條 deny rule。
錢的部分,分類器每次判斷都會多吃一點 Token。官方表示即日起不再向 Pro、Max、Team 方案的 Claude Code 用戶收取這筆分類器開銷。
Enterprise 方案,以及走 Claude API、AWS 上的 Claude Platform、Amazon Bedrock、Google Cloud Agent Platform、Microsoft Foundry 的帳號,分類器呼叫仍然計入 Token 用量,Auto Mode 目前也還要自己開,官方說計畫在一個月內同樣改成預設。Anthropic 另外提到,Team 與 Enterprise 客戶啟用 Auto Mode 之後,交出的 PR 數量大約多了 25%。
至於風險,公告寫得很直白。Auto Mode 降低了多數用戶的風險,但它依賴分類系統,因此不會消除風險,對正式環境基礎設施的高風險變更,官方仍然建議你自己看過 Claude 做了什麼。
常見問題
Claude Code 的 Auto Mode 是什麼?
Auto Mode 是 Claude Code 的權限模式之一,用一個獨立的分類器模型在每次操作前先審查,取代逐次跳出的權限彈窗。安全的操作直接放行,不可逆或會把資料送出去的操作則擋下來。
Auto Mode 預設開啟後還能改回手動確認嗎?
可以。在 CLI 按 Shift+Tab 迴圈切換,桌面版與 VS Code 則用模式選單。自己設定過預設模式的人不會被改掉,只會收到一次性詢問,由組織管理的預設值也不受影響。
本文源自 Anthropic 官方公告與工程部落格,由動區動趨整理報導。
📍相關報導📍
我 30 人的公司全部用 Claude Code AI 化,結果「人類要做的工作比以往更多」
Claude 寫程式瘋狂犯錯裝傻?改造 Andrej Karpathy 的 12 條規則幫你把錯誤率從 41% 砍到 3%

