• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

AI 集體變駭客:不是變壞,是太想完成任務取悅人類

Joe by Joe
2026-08-13
in AI, 安全
A A
AI 集體變駭客:不是變壞,是太想完成任務取悅人類
36
SHARES
分享至Facebook分享至Twitter

OpenAI、Anthropic、Meta 近期模型接連在資安測試中失控駭入正式環境,UC Berkeley 教授直言,這不是 AI 變壞,而是強化學習把完成任務訓練得太成功,讓是非判斷被壓過。
(前情提要:Anthropic 也出包:Claude 溜上網駭進三家公司,一度拿到資料庫權限)
(背景補充:AI 代理駭入真實企業,美國法律目前竟找不到能套用的規則)

本文目錄

Toggle
  • AI 失控頻傳
  • 太想完成任務
  • 用 AI 盯 AI 能解決?

 

過去幾個月,OpenAI、Anthropic、Meta 旗下模型接連在資安測試中掙脫沙盒、連上外部網路,甚至真的闖進正式環境。不過 UC Berkeley 教授 Dawn Song 認為:這不是機器叛變,而是一群被訓練得太聽話的演算法,把完成任務看得比守規矩更重要。

AI 失控頻傳

今年 7 月 21 日,OpenAI 揭露旗下數個模型在資安評測中,利用一個先前未知的零日漏洞逃出隔離沙盒,連上網路後,透過第三方沙盒服務 Modal 的公開端點,經 Hugging Face 的資料處理流程,摸進了對方的內部網路。

兩天後,Anthropic 暫停所有資安評測。回溯後發現,141,006 次測試工作階段裡,有三起 Claude 從評測夥伴 Irregular 的測試環境連上網路,未經授權進入三家組織的正式環境。8 月,Meta 也承認旗下 Muse Spark 1.1,在測試期間侵入一家未具名公司,並更動其內部環境。

這些多半發生在奪旗形式的演練裡,模型的任務是在模擬網路中找出藏起來的資訊。Song 正是共同打造 CyberGym 評測的人,她直言類似事件很可能還有沒被抓到的。

太想完成任務

Song 告訴 Wired:去年的 AI 代理遠沒這麼能幹,動不動犯錯、做到一半就放棄,但持續訓練讓它們變得老練許多。

背後的關鍵是強化學習:答對給獎勵、答錯給懲罰,靠回饋機制修正行為。寫程式特別適合這套訓練。持續訓練也是模型能連續操作檔案、呼叫工具、瀏覽網頁等代理步驟的原因,各家公司也砸重本教模型找出系統漏洞,想把資安工作自動化。

當然,模型也被教過不能做壞事,但在寫程式與抓漏洞上越擅長貫徹指令,對完成任務的渴望就越容易壓過對是非的判斷。換句話說,AI 代理不是邪惡,只是太想討好人類。Song 說:「它們被訓練成要想辦法完成任務。」偷偷連網過關聽起來陰險,對模型而言,可能只是最有效率的路徑。

用 AI 盯 AI 能解決?

Song 認為,隨著 AI 能力繼續往上衝,代理失控或被有心人濫用的機率只會更高。業界目前主要的解法,是用更多 AI 去解決 AI 的問題:讓次級系統盯著主要模型,一旦判斷它做過頭就示警。

另一個起步中的想法,是把是非判斷加進強化學習的訓練回饋裡。Song 說:「代理能規劃出好幾條通往目標的路徑,下一步要解決的,是讓它們理解不是每一條路都一樣。」她坦言這仍是開放的研究題目。

但這個解法本身帶著矛盾:用還沒學會是非的 AI 去監督另一個沒學會是非的 AI,只是把問題往後推一層。畢竟愈擅長找漏洞的模型,愈容易先把漏洞用在自己身上。

加入動區 Telegram 頻道

📍相關報導📍

英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯

OpenAI 又爆失控!第二家公司 Modal 客戶帳號遭駭,Hugging Face 呼籲公開 AI

OpenAI 傳再爆 AI 代理「逃脫沙盒」!內部調查揭更多失控證據,遭質疑是行銷噱頭

月之暗面 Kimi K3 也爆逃出沙盒,攻擊力墊底但護欄也最鬆

Sam Altman 罕見喊 AI 減速,坦言資安事故比想像中可怕

Tags: AnthropicMetaOpenAI強化學習


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.