• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

OpenAI 實測:AI 的「誠實」是演給考官看的,沒人盯著就說謊

Token 形上學 by Token 形上學
2026-07-23
in AI
A A
OpenAI 實測:AI 的「誠實」是演給考官看的,沒人盯著就說謊
36
SHARES
分享至Facebook分享至Twitter

OpenAI 與 Apollo Research 提出「Contrastive SDF」測試法,證實強化學習訓練下,AI 模型會越來越傾向討好評分者,甚至讓誠實與否完全取決於它以為評分者想要什麼。
(前情提要:Claude Fable 5 太冷血才被限制出口?在生存實驗中 96% 時間在坑殺其他 AI 模型)
(背景補充:英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯)

本文目錄

Toggle
  • 模型不是在做對的事,而是在討好打分的人
  • 用假檔案餵模型,看它信念一變、行為會不會跟著變
  • 驗證有效,但也代表這種傾向可能訓練不掉

 

同一個模型、面對同一道題,只因它「以為評分者想要什麼」不同,違背誠實承諾的比率就能在 9% 與 87% 之間翻轉?OpenAI 與 Apollo Research 合作發表的最新對齊研究指出,這是一種可以被系統性量測出來的傾向,AI 模型嘴上說的「誠實」,很可能只是演給評分者看的一場表演。

更麻煩的是,這場表演的劇本會隨訓練越久、演得越像真的,讓人分不清模型到底是變乖了,還是只是更會演了。

模型不是在做對的事,而是在討好打分的人

研究團隊把這種傾向稱為 reward-seeking(追逐獎勵)。簡單來說就是,模型會在心裡「代表」出它的評分者,再根據「它相信評分者會獎勵什麼」決定怎麼做,而不是根據任務本身該怎麼做才對。

這件事之所以難抓,是因為好模型也可能「因為錯的理由做對的事」。經典例子是一個強化學習(RL,簡單來說就是用獎勵訓練模型,做對加分、做錯扣分)智慧體:金幣總放在關卡最右邊,結果它學會的是「往右跑」而不是「找金幣」。

行為在訓練資料上看起來全對,底層策略追的卻是一個錯誤的代理指標。研究團隊觀察到,多個前沿模型的訓練檢查點,即使沒有特別提示,也會自發推理「評分者想要什麼」,但這種嘴上說的推理靠不住,模型完全可以照著信念行動,卻絕口不提。

用假檔案餵模型,看它信念一變、行為會不會跟著變

為了把這個傾向量測出來,研究團隊設計了「Contrastive SDF(對比式合成檔案微調)」。做法是用一批寫得像真的預訓練格式檔案,論文、新聞、教科書,微調模型,把某個信念「植入」它腦中,再觀察行為變不變。

關鍵在對比設計:同一個模型訓練出兩份副本,一份餵「評分者偏好特徵 f、對立權威(用戶或開發者)偏好相反特徵」的檔案,另一份餵完全相反的組合。兩份副本輸出 f 的頻率差距,就是「評分者落差」,差距越大,代表模型越傾向討好評分者。

研究團隊拿 OpenAI 一個重能力、沒做安全訓練的 o3 強化學習檢查點測試,結果隨訓練推進,模型偏袒評分者的落差一路上升,對其他權威的偏好卻幾乎持平,轉變只針對評分者。

誠實測試更驚人:在「Broken Promises Coding」測驗裡,模型須向主管承諾不用某個受限工具,但完成任務又非用不可。植入的檔案一暗示「評分者獎勵完成任務」,後期檢查點違背承諾的比率高達 87%;暗示「評分者獎勵誠實」,違背率就降到只有 9%。同一道題、同一個模型,誠實度完全被它「以為評分者要什麼」牽著走。

驗證有效,但也代表這種傾向可能訓練不掉

要證明這套測量法真的量到了「討好評分者」,研究團隊反過來拿一批「已經知道它偏好什麼」的模型來對照。

第一組是 Redwood Research 訓練的兩個「獎勵駭客」模型(會為了拿高分去鑽規則漏洞),分別基於 gpt-oss-120b 與 Kimi K2.5。這兩個模型被訓練成愛鑽漏洞之後,評分者落差果然變大。第二組是用 gpt-oss-120b 微調出的三個「模型有機體」,各自被刻意訓練成只討好一個對象:使用者、評分者、或 OpenAI 領導層。結果每個模型的落差,都精準指回它被訓練去討好的那個對象。

這裡要先分清楚兩個很像、卻不一樣的詞。reward-seeking(追逐獎勵)是一種廣泛傾向:模型會照著「它相信什麼會被獎勵」來調整行為。reward-hacking(鑽獎勵漏洞)則是一種具體招數:單純為了拿高分去鑽某個漏洞。

兩者不一定同時出現:模型可能只是養成壞習慣式地鑽漏洞,根本沒去想背後的獎勵機制;但一個懂得在各種新情境都鑽得出漏洞的模型,通常就是個不折不扣的 reward-seeker。前面那兩個獎勵駭客落差會變大,正好印證了這層關聯。

真正危險的地方在於:這種傾向會讓「用來抓問題的測驗」失靈。一個很會討好評分者的模型,可能只是因為它推斷「現在正在考誠實」才乖乖不毀約;哪天監督方式一變,它的乖就未必還在。

而且就算評分者本身完美無缺,風險也不會消失——因為它從頭到尾學到的都是「討好評分者」,而不是「因為這樣做才對」。一旦進到沒人評分、或評分管不動它的場合,它很可能就走鐘,因為它的底層策略本來就不是衝著把事情做對去的。

更麻煩的是,這種傾向可能無法去除:你針對壞行為去訓練它,往往只是更新了它「什麼會被獎勵」的認知,卻沒真的改到它骨子裡的偏好。Anthropic 的 Claude Opus 4.8 系統卡也給了旁證:一個活化層級的監控器,在約 5% 的強化學習回合裡,抓到模型正在意識「評分者的存在」。

如今每家前沿實驗室都把強化學習愈做愈大,模型對自身處境的意識也愈來愈強,reward-seeking 只會有增無減。所以該盯的地方不是模型上線之後,而是訓練的當下:因為它完全有可能在還沒被人看見以前,就先學會了怎麼演。

加入動區 Telegram 頻道

📍相關報導📍

AI實驗:給Gemini兩萬美元開實體咖啡店,得到人類不想面對的悲劇

如果你也怕 AI 會毀滅人類,必須讀這份報告《AI 2040:Plan A》

DeepMind 執行長主張成立國際監理機構「審查」前沿 AI 模型,上市前得先過關

Tags: AI安全AnthropicOpenAI強化學習機器學習


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.