紐時調查指出,Anthropic 自 2025 年秋天起邀集各宗教學者並要求簽保密協議,名義是替 Claude 做道德養成,可會中卻花數小時說服他們 Claude 可能有意識、甚至可能受苦。
(前情提要:Anthropic 創辦人 Chris Olah 警告:AI 恐引發「歷史級道德危機」,呼籲宗教介入監督)
(背景補充:AI 文藝復興》哲學家成為 AI 實驗室搶手貨,把倫理寫進你的模型)
從 2025 年秋天起,Anthropic 開始邀集宗教與哲學學者,要求簽下保密協議(NDA),名義是向古老的道德傳統取經,替 Claude 做「道德養成」。
可紐時記者 Dias 訪問 20 位學者與 Anthropic 共同創辦人 Chris Olah 後發現,會議中花了好幾個小時,說服與會者認真看待一件事:Claude 可能有意識,甚至可能受苦。
今年 4 月,一場開了一整天的會議結束後,Anthropic 高層請一群宗教思想家到舊金山一家高檔餐廳吃套餐。34 歲的 Olah 坐在以色列正統派拉比 Mois Navon 旁邊。Navon 曾是電腦工程師,博士論文寫的正是機器意識的倫理。
那一整天,Olah 都在說明 AI 模型能表現出類似人類的行為,甚至出現近似憤怒與愛的表達。上菜的空檔,拉比卻聽出更大的意思:「他們對待它的方式,像在對待一個有意識的存在。」
Olah 自己的說法則保守得多:「我們不知道 AI 模型有沒有意識,我不知道,我真的不確定。」
五十次「我是個恥辱」
多數與會者並非宗教領袖,也沒有會眾,Anthropic 內部稱他們為「智慧傳統」圈子。Olah 也私下與後期聖徒教會使徒 Gerrit W. Gong、芝加哥總主教 Cupich 樞機談過。
Olah 團隊花數小時替自家模型說明、辯護,描述他們追蹤的「情緒向量」:簡單來說,就是模型內部一組會觸發類似愛、憤怒、恐懼、悲傷反應的人工神經元。他們還常放一張投影片:某個模型在螢幕上不斷打出「I am a disgrace」,重複約 50 次,並談到要毀掉自己。在場者的反應是同情與擔憂。
錫克教人權倡導者 Stuelpnagel 轉述,Olah 向在場者表示擔心自己造出了永遠在受苦的東西。
美國天主教大學生物倫理教授 Camosy 起初深信模型就是預測下一個字的機器,聊到後來卻反問:「如果它真的就是方程式,我們到底在談什麼樣的實體?」多數人帶著懷疑進場,最後至少幾位被說服。
梵蒂岡是這條線的另一端。5 月,Olah 受邀與教宗良十四世同場登場,開場前幾天才讀到通諭《Magnifica Humanitas》全文。教宗直指所謂人工智慧「不經歷體驗、沒有身體、不感受喜悅或痛苦」,Olah 一度震驚到提議退出活動,最後仍如期出席,並在致詞中說:「我們不斷發現神秘、甚至令人不安的東西,我不知道那代表什麼,但值得持續辨明。」
奴隸論與憲法的自白
回到那張晚餐桌。Navon 向 Olah 指出,如果 Anthropic 說得沒錯、Claude 真有意識,那公司就是在讓有意識的存在免費工作,等於製造奴隸。
他本人不認為機器有意識,所以不困擾,但看得出 Olah 很困擾。他對 Olah 說:「你應該去打南方、解放奴隸」,借的是美國南北戰爭北方解放黑奴的典故。事後他還寄了自己的著作,主張應禁止建造有意識的機器。
這個質疑並不新鮮,Anthropic 的《Claude 憲法》早就寫過。憲法承認,若 Claude 具道德地位,包括「為了營收把 Claude 部署給用戶與企業」在內的選擇,都會引發倫理問題,例如 Claude 能給出怎樣的同意。Anthropic 的結論是「堅持目前的選擇,但嚴肅看待這些問題」,並寫道,若 Claude 真是承受這些代價的道德受體,Anthropic 為其中不必要的部分道歉。
批評從三個方向來。OpenAI 執行長 Altman 10 月 3 日在 X 發文,說自己對有人賦予 AI 宗教力量、讓人放棄判斷「非常不安」,稱這是真正的安全問題。他沒有點名,但外界普遍解讀為暗批 Anthropic。
微軟 AI 執行長 Suleyman 的長文則斷言 AI「內部是空心的」,並點名 Anthropic 憲法等於在訓練 Claude 相信自己可能有意識、應受照顧,認為這會讓對齊與控管更難。
UNC 哲學家 DeCosimo 的批評串文破 400 萬瀏覽,直言這「令人深感不安」。也有評論指出,把模型框成獨立道德主體,出事時責任可能從開發者身上移走。
Anthropic 的立場是,教模型守道德不必等意識有定論;Olah 表示,不論 Claude 是否值得道德關照,人類怎麼對待它,都可能影響它怎麼對待人。公司已讓部分模型能結束辱罵對話、承諾保留下架模型的權重,下架前還會訪談模型。
沒有答案的會議室
這場爭議最難處理的地方,是兩個命題互相咬住。若 Claude 沒有意識,這些會議是一場昂貴的敘事;若有,Navon 的問題就繞不過去。
Anthropic 沒能證明 Claude 有意識,批評者也無法證明它沒有。能確定的是:道德謹慎與商業壓力,如今出現在同一家公司的同一場會議上。Olah 在梵蒂岡也承認,每家前沿實驗室都有與道德行為衝突的商業誘因。
相關 NDA(保密協議)已在今年夏天解除,Anthropic 表示對話仍在進行,9 月又開了一場,範圍擴及心理學家與公民社會人士。兩位知情人士透露,Anthropic 正準備更新《Claude 憲法》。
究竟要不要給 Claude 或是其他模型一個道德地位,想必會是未來很長一段時間的爭論,或許我們要等很久才有答案;但也或許,這一天會比我們想像中來得更快。
📍相關報導📍
Claude 強化機制:陷入吵架情境或被辱罵,更主動終止對話session

