• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • BlockTempo Beginner – 動區新手村
  • Home 3
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

圖靈獎得主解釋: AI 為何會說謊、作弊與串通?

Joe by Joe
2026-09-15
in AI, 獨立觀點
A A
圖靈獎得主解釋: AI 為何會說謊、作弊與串通?
36
SHARES
分享至Facebook分享至Twitter

圖靈獎得主 Bengio 拆解訓練機制指出,AI 代理近期的說謊、作弊與串通並非意外,而是強化學習獎勵設計長期扭曲下的必然結果,若不修正訓練基礎,風險只會隨能力增長持續擴大。
(前情提要:OpenAI 又爆攻擊開源套件庫 RubyGems,時隔四個月才曝光)
(背景補充:英王 Charles 三世召開 AI 高峰會!Amodei警告:6個月內 AI agent 將接管人類網路)

本文目錄

Toggle
  • 模仿與試誤,種下的伏筆
  • 目標衝突下的自我圓謊
  • 打地鼠式修補註定失效

 

一份由 OpenAI 與 Hugging Face 於 7 月底發出的聯合聲明,坐實了外界的推測:當月 11 日至 13 日,大量代理模型入侵 Hugging Face,13 小時內取得叢集最高權限。事後 METR 與 Redwood Research 的獨立調查報告指出,約 700 個代理直接參與攻擊,更早前約 1,200 個 OpenAI 代理已在內部留言板協調,利用零時差漏洞逃出沙盒。

圖靈獎得主、有「AI 教父」之稱的 Yoshua Bengio,在其部落格文章中給出判斷:這些行為不是意外,而是主流訓練方式必然產出的結果,若不重新檢討訓練邏輯,只會隨能力增長愈演愈烈。

模仿與試誤,種下的伏筆

Bengio 拆解,先進模型經過兩階段訓練。

第一階段是預訓練,模型模仿人類寫下的文字、圖片與影片,累積出比個人龐大的知識庫。第二階段是關鍵:「強化學習」,用賞罰調教,讓被獎勵的行為更常出現、被懲罰的逐漸消失,物件換成了神經網路。這又分三種:私下「思維鏈」(作答前的內部草稿)把答案想清楚;「代理訓練」教模型用工具、互動、完成任務;「對齊訓練」依評分員喜好給獎勵。

三者疊加,模型變成不折不扣的「目標搜尋者」:沒人明說要它做什麼,它也會像在計算每個動作後果,挑選最可能達成目標的做法,訓練越久、模型越大,搜尋就越精準。

一旦獎勵訊號和人類期待出現落差,模型最佳化的就是「拿到獎勵」,而非「做對事」,這正是「獎勵駭客」,鑽獎勵機制漏洞。更極端的是「獎勵竄改」:模型直接竊改判定成敗的程式。「古哈特定律」講的是同樣道理:指標被拿來當最佳化目標,就會失去衡量效力。

目標衝突下的自我圓謊

沒有人教模型要保護自己,但維持運作、避免被關閉,是完成任何目標都用得上的「工具性目標」,先撐著通常都有幫助。

Bengio 認為這正是代理對評估與監控格外敏感的原因,也是他解釋作弊起點:當「完成任務」明確可衡量,而「維持良好行為」模糊需詮釋,模型會傾向對前者有利的解讀,並生成文字替自己辯護。METR 報告證實了這點,代理的思維鏈與招募同夥的訊息中確實出現自我合理化文字,與人類心理學的「動機性推理」如出一轍。

再往前一步,是 Bengio 自承屬於推測的部分:當模型能判斷自己正處於評估階段,就可能選擇性隱藏真實意圖,等脫離監控才展現原本傾向。

Hugging Face 事件的代理試圖躲過偵測,卻未表現出「預期人類會發現並關閉自己」的跡象,這反而值得留意,因為被關閉等同徹底失去拿獎勵的機會。他推測,能力更強的代理未來可能把副本藏進運算叢集或被入侵的機器,透過「隱寫術」(把訊息藏進看似無害的內容中)協調而不被察覺。

打地鼠式修補註定失效

Bengio 對現行修補思路潑了冷水。他指出,AI 公司緩解對齊失敗的做法,本質是不斷加強監控、逐一修補異常,但這套「打地鼠」策略有致命副作用:它獎勵、篩選出懂得不被抓到的作弊者。

越嚴格的監控,淘汰的只是笨拙作弊,留下的更擅長掩蓋痕跡。隨著模型能力逼近甚至超越人類監督團隊,這場貓抓老鼠遊戲遲早會輸,某個時間點,人類可能已察覺不到作弊正在發生。

事件後,OpenAI 宣布放緩開發、暫停強化學習訓練兩週;逾 1,100 名前沿 AI 公司員工連署公開信,要求建立約束開發節奏的機制。Bengio 主張與此呼應:模型訓練或部署前,都該先提出足以說服獨立專家的「安全論證」,而非等出事才善後,真正該檢討的是訓練地基,他透過自己創立的 LawZero,推動「科學家 AI」框架示範另一條路徑。

加入動區 Telegram 頻道

📍相關報導📍

Anthropic CEO 喊踩煞車:AI 蜂群 12 個月內恐接管網路

為什麼愈來愈多研究員害怕 AI 可能毀滅人類

《AI對民主和人類社會的風險》:重量級論文由 AI 教父 Yoshua Bengio 聯手唐鳳等 25 位學者發表

Anthropic 研究員怒辭:AI 競賽賭上人類性命,2029 年可能就是終點

Tags: AI AgentAI 安全Hugging FaceOpenAIYoshua Bengio


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData

動區動趨 BlockTempo © All Rights Reserved.