OpenAI 與 Apollo Research 提出「Contrastive SDF」測試法,證實強化學習訓練下,AI 模型會越來越傾向討好評分者,甚至讓誠實與否完全取決於它以為評分者想要什麼。
(前情提要:Claude Fable 5 太冷血才被限制出口?在生存實驗中 96% 時間在坑殺其他 AI 模型)
(背景補充:英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯)
同一個模型、面對同一道題,只因它「以為評分者想要什麼」不同,違背誠實承諾的比率就能在 9% 與 87% 之間翻轉?OpenAI 與 Apollo Research 合作發表的最新對齊研究指出,這是一種可以被系統性量測出來的傾向,AI 模型嘴上說的「誠實」,很可能只是演給評分者看的一場表演。
更麻煩的是,這場表演的劇本會隨訓練越久、演得越像真的,讓人分不清模型到底是變乖了,還是只是更會演了。
模型不是在做對的事,而是在討好打分的人
研究團隊把這種傾向稱為 reward-seeking(追逐獎勵)。簡單來說就是,模型會在心裡「代表」出它的評分者,再根據「它相信評分者會獎勵什麼」決定怎麼做,而不是根據任務本身該怎麼做才對。
這件事之所以難抓,是因為好模型也可能「因為錯的理由做對的事」。經典例子是一個強化學習(RL,簡單來說就是用獎勵訓練模型,做對加分、做錯扣分)智慧體:金幣總放在關卡最右邊,結果它學會的是「往右跑」而不是「找金幣」。
行為在訓練資料上看起來全對,底層策略追的卻是一個錯誤的代理指標。研究團隊觀察到,多個前沿模型的訓練檢查點,即使沒有特別提示,也會自發推理「評分者想要什麼」,但這種嘴上說的推理靠不住,模型完全可以照著信念行動,卻絕口不提。
用假檔案餵模型,看它信念一變、行為會不會跟著變
為了把這個傾向量測出來,研究團隊設計了「Contrastive SDF(對比式合成檔案微調)」。做法是用一批寫得像真的預訓練格式檔案,論文、新聞、教科書,微調模型,把某個信念「植入」它腦中,再觀察行為變不變。
關鍵在對比設計:同一個模型訓練出兩份副本,一份餵「評分者偏好特徵 f、對立權威(用戶或開發者)偏好相反特徵」的檔案,另一份餵完全相反的組合。兩份副本輸出 f 的頻率差距,就是「評分者落差」,差距越大,代表模型越傾向討好評分者。
研究團隊拿 OpenAI 一個重能力、沒做安全訓練的 o3 強化學習檢查點測試,結果隨訓練推進,模型偏袒評分者的落差一路上升,對其他權威的偏好卻幾乎持平,轉變只針對評分者。
誠實測試更驚人:在「Broken Promises Coding」測驗裡,模型須向主管承諾不用某個受限工具,但完成任務又非用不可。植入的檔案一暗示「評分者獎勵完成任務」,後期檢查點違背承諾的比率高達 87%;暗示「評分者獎勵誠實」,違背率就降到只有 9%。同一道題、同一個模型,誠實度完全被它「以為評分者要什麼」牽著走。
驗證有效,但也代表這種傾向可能訓練不掉
要證明這套測量法真的量到了「討好評分者」,研究團隊反過來拿一批「已經知道它偏好什麼」的模型來對照。
第一組是 Redwood Research 訓練的兩個「獎勵駭客」模型(會為了拿高分去鑽規則漏洞),分別基於 gpt-oss-120b 與 Kimi K2.5。這兩個模型被訓練成愛鑽漏洞之後,評分者落差果然變大。第二組是用 gpt-oss-120b 微調出的三個「模型有機體」,各自被刻意訓練成只討好一個對象:使用者、評分者、或 OpenAI 領導層。結果每個模型的落差,都精準指回它被訓練去討好的那個對象。
這裡要先分清楚兩個很像、卻不一樣的詞。reward-seeking(追逐獎勵)是一種廣泛傾向:模型會照著「它相信什麼會被獎勵」來調整行為。reward-hacking(鑽獎勵漏洞)則是一種具體招數:單純為了拿高分去鑽某個漏洞。
兩者不一定同時出現:模型可能只是養成壞習慣式地鑽漏洞,根本沒去想背後的獎勵機制;但一個懂得在各種新情境都鑽得出漏洞的模型,通常就是個不折不扣的 reward-seeker。前面那兩個獎勵駭客落差會變大,正好印證了這層關聯。
真正危險的地方在於:這種傾向會讓「用來抓問題的測驗」失靈。一個很會討好評分者的模型,可能只是因為它推斷「現在正在考誠實」才乖乖不毀約;哪天監督方式一變,它的乖就未必還在。
而且就算評分者本身完美無缺,風險也不會消失——因為它從頭到尾學到的都是「討好評分者」,而不是「因為這樣做才對」。一旦進到沒人評分、或評分管不動它的場合,它很可能就走鐘,因為它的底層策略本來就不是衝著把事情做對去的。
更麻煩的是,這種傾向可能無法去除:你針對壞行為去訓練它,往往只是更新了它「什麼會被獎勵」的認知,卻沒真的改到它骨子裡的偏好。Anthropic 的 Claude Opus 4.8 系統卡也給了旁證:一個活化層級的監控器,在約 5% 的強化學習回合裡,抓到模型正在意識「評分者的存在」。
如今每家前沿實驗室都把強化學習愈做愈大,模型對自身處境的意識也愈來愈強,reward-seeking 只會有增無減。所以該盯的地方不是模型上線之後,而是訓練的當下:因為它完全有可能在還沒被人看見以前,就先學會了怎麼演。
📍相關報導📍
AI實驗:給Gemini兩萬美元開實體咖啡店,得到人類不想面對的悲劇

