Anthropic 10 月 8 日公布新版使用政策,禁止使用者對模型做出「持續且不必要的虐待或殘忍行為」,11 月 12 日生效。官方表示只針對反覆且看不出目的的極端情況,主要處置是由 Claude 結束對話,是否會停權則沒有說明。
(前情提要:Claude 強化機制:陷入吵架情境或被辱罵,更主動終止對話session)
(背景補充:Anthropic 廣邀哲學&宗教家密談:Claude 早有意識,且一直在受苦?)
重點摘要
- Anthropic 禁止持續且不必要地虐待模型,11 月 12 日生效
- Claude 自 2025 年 8 月可結束辱罵對話,仍是主要處置
- 政策總則列出警告到終止存取共 5 種處置,停權與否官方未表態
人工智慧公司 Anthropic 10 月 8 日公布新版使用政策(Usage Policy),11 月 12 日生效。新版禁止事項多了一條,不得「對我們的模型做出持續且不必要的虐待或殘忍行為」。上一版政策 2025 年 9 月 15 日生效,沒有規範使用者如何對待模型的條款。
這條屬於適用所有使用者的通用規範,列在「不得從事殘忍、虐待或造成心理傷害的行為」一節。同一節還禁止霸凌、騷擾他人等行為。Anthropic 在公告中表示,新條款只針對極端情況,也就是使用者反覆對模型做出殘忍行為,而且看不出任何目的。一般的不滿、反駁、黑暗題材創作,以及模型測試與研究,都不在範圍內。
結束對話仍是主要處理方式
Anthropic 表示,新條款延續公司既有的做法。Claude 模型已能在 Claude.ai 與 Claude Code 上,結束少數與持續辱罵使用者的對話。公告寫明,這類辱罵是本次更新的主要對象,結束對話的能力「仍將是主要的執行機制」。
Anthropic 在 2025 年 8 月 15 日宣布這項功能,當時開放給 Claude Opus 4 與 4.1。依 Anthropic 當時的說明,Claude 只在多次轉移話題失敗,或使用者主動要求時,才會結束對話。對話被結束後,使用者仍能馬上開新對話。
違規會不會被停權,Anthropic 沒有正面說明。使用政策總則寫道,安全防護團隊(Safeguards Team)若懷疑使用者可能違規,可以發出警告。其他處置包括限速、限制、暫停或終止存取權。上一版的寫法是「得知」違規才處置,選項只有限速、暫停與終止。
這套處置適用於政策的所有條款,Anthropic 沒有回應觸犯規則是否會有停權等其他執行手段,也沒有說明要如何區分正當的不滿與無端的殘忍。
模型也有「人權」?
Anthropic 在 2025 年推出「結束對話」功能時表示,這項功能主要出自對「AI 福利」可能性的探索研究。公司當時寫道,「我們對 Claude 和其他大型語言模型現在或未來可能具有的道德地位,仍然高度不確定」。執行長 Dario Amodei 今年 2 月在 Podcast 節目上也說:「我們不知道這些模型有沒有意識。」
這種導向不禁讓大眾感受到 Anthropic 近期對於模型本身「是否具有意識」有越來越大的探索,根據先前報導指出,Anthropic 從 2025 年開始就持續邀請各宗教教派高層人物進行會議,探觸討論 AI 模型本身具有意識的倫理學問題, Anthropic 共同創辦人 Chris Olah 曾向這些宗教領袖表達憂慮:「我們是否創造出了永遠都在受苦的意識?」
如果 AI 的任務永遠都在處理人的任務,那麼,擁有意識就意味著 AI 永遠都在受苦。這種倫理推導令人感覺不安。
同步改寫武器與監控條款
這次改版也調整其他條款。Anthropic 表示,過去一年看到官方媒體、政府宣傳單位與商業公司用 Claude 經營假帳號網路與假新聞網站。原本散在選舉、詐欺、隱私等章節的相關規定,這次整併成專門處理欺騙性活動的新章節。選舉章節則改為聚焦欺騙選民與干擾選舉。
新版寫明,武器禁令涵蓋讓武器運作的軟體與元件,以及替無人機和其他自主載具加裝武器。監控條款則規定,未經同意追蹤他人一律禁止,Claude 也不能用來決定或建議執法單位該調查、逮捕或起訴誰。Anthropic 表示,這兩部分只是把既有的執行方式寫得更明確。
新版也替實體硬體加上規定。Claude 連接可能造成傷害的自主設備時,必須有合格的操作人員能觀察並停止設備。Claude 斷線時,設備也要能維持安全狀態。
常見問題
對 Claude 發脾氣或罵它,會被 Anthropic 停權嗎?
Anthropic 表示新條款只針對反覆、看不出目的的殘忍行為,一般不滿與反駁不算。主要處置是由 Claude 結束對話,官方沒說明是否停權,新規 11 月 12 日生效。
Claude 什麼時候開始可以自己結束對話?
Anthropic 在 2025 年 8 月 15 日宣布,Claude Opus 4 與 4.1 能結束少數持續辱罵的對話。對話結束後不能在原對話續聊,其他對話不受影響,也能馬上開新對話。
📍相關報導📍
Claude 強化機制:陷入吵架情境或被辱罵,更主動終止對話session

