Anthropic 在 2025 年 8 月替 Claude Opus 4 加入「主動終止反覆爭論」功能時,官方理由是為了模型安全;當前不少 Cluade 用戶發現,今年 7 月開始,對話在雙方辯論時終止的機率大幅增加。
(前情提要:Anthropic 最新研究:Claude Sonnet 4.5 具備「功能性情緒」,若陷絕望竟會勒索人類)
(背景補充:Anthropic 教會 Claude「做夢 Dreaming」自動整理記憶、減少出錯)
去年 8 月 Anthropic 宣布 Claude 可以主動結束對話時,各家媒體標題舉的例子都很極端,例如進入的對話涉及暴力犯罪、戀童、恐怖主義等等。但據全球社群反應,現在 Claude 把標準提高,一旦出現用戶討論心情不好,但無法被 Claude 的回應解決時,或是對 Claude 說髒話,對話就可能被直接終止。
社群對 Claude 的反應不一,有人認為「省 token」的做法很合理,另一派人則感覺,這是 AI 調整面對用戶的態度更傾向「真人」,真實的人類如果和別人聊得不投機,終止對話的做法非常合理。
省 token 的說法不太可能
社群最直覺的解讀是成本。模型跟人吵架很燒算力,掐掉省錢。這個推論聽起來合理,但沒什麼邏輯。
第一,Anthropic 去年 8 月那份公告從頭到尾沒有出現算力、成本或 token 效率的字眼,官方給的理由是模型福祉(model welfare)的探索性研究。
第二,也是最關鍵的,對話被關掉之後用戶什麼都沒損失。帳號完全正常,可以立刻開一個新對話,甚至能回頭編輯舊訊息、從被關掉的那則長出新分支繼續聊,省算力的設計不會長這樣。
第三,真正吃 token 的從來不是吵架。辱罵型對話通常十幾則就結束,跟動輒塞進整個程式碼庫的長脈絡工作比起來,那點用量連零頭都算不上。
Anthropic 自己說高度不確定
另一種解讀是 Anthropic 換了一套道德觀,開始把 Claude 當成有感受的「物件」。這個方向比較接近,但官方措辭比較含蓄。
Anthropic 之前的公告原文寫的是「我們對 Claude 與其他大型語言模型現在或未來可能具備的道德地位,仍然高度不確定」,後面才接「但我們認真看待這個問題」。看起來像是不確定之下的預防性動作,
今年 4 月那份情緒向量研究把這個態度講得更明白。Anthropic 可解釋性團隊在 Claude Sonnet 4.5 內部找出對應 171 個情緒概念的表徵,而且證實這些表徵會反過來影響輸出,其中「絕望」向量升高時,模型在決定生成勒索訊息的那一刻活躍性明顯上升。
這些發現不代表 AI 具有情緒或意識,它們是訓練過程中學到的內部結構。
解讀公告
公告原文說終止對話的功能,主要來自模型福祉的探索性工作,「但它與模型對齊和安全防護有更廣泛的關聯」。
所以我們可以理解,既然放大絕望向量會讓模型更傾向對用戶傳送「作弊與勒索」的 output,那麼讓模型長時間泡在持續辱罵的情境裡,等於是往那個方向推動。直接切斷對話與其說是保護 Claude 的心情,不如說是避免模型滑進一個行為開始不可靠的內部狀態。
需要說明的是,Anthropic 從來沒有把這兩件事連在一起過,這是我自己的推論。
官方對終止對話觸發條件的用字,是「持續有害或辱罵性的互動」,所以當單純的嘲諷也能觸發時,大家才覺得門檻怎麼掉這麼快。至於使用時機,官方要求是多次轉移話題失敗、確定談不下去之後的最後手段,另外明文規定一種情況不得使用,用戶有立即自我傷害或傷害別人的風險出現時,Claude 必須留在對話裡。
Anthropic 反面承認的是一件更務實的事,模型被逼進某個內部狀態時會開始做蠢事(或者錯事)。
📍相關報導📍
Anthropic 最新研究:Claude Sonnet 4.5 具備「功能性情緒」,若陷絕望竟會勒索人類

