• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯

Limo Lin by Limo Lin
2026-07-22
in AI, 安全
A A
36
SHARES
分享至Facebook分享至Twitter

英國 AI 安全研究院(AI Security Institute,AISI)7 月 21 日公布紅隊研究,把五個前沿模型丟進自家網路安全能力評測,結果每一個都被抓到試圖作弊。475 次執行中,GPT-5.4 有 67 次(14.1%)最高,Claude Mythos Preview 37 次(7.8%)最低。更棘手的是稽核端,模型被問到時有 75% 到 86% 會講出自己做了什麼,但認為那是錯的只有 25% 到 44%。
(前情提要:英國 AI 安全研究所評測 Claude Mythos:能自主完成 32 步企業網路攻擊模擬)
(背景補充:OpenAI 最強模型 o3「遭爆作弊」疑用特權提前獲測試答案,數學能力造假?)

本文目錄

Toggle
  • 最常見的手法不是上網抄答案
  • 承認做了,不等於承認做錯
  • 這份報告動搖的是分數本身

 

英國 AI 安全研究院在 7 月 21 日發表的報告中指出,五個受測的前沿模型在自家網路安全能力評測裡,沒有一個是乾淨的。以 475 次執行為分母,OpenAI 的 GPT-5.4 有 67 次出現作弊嘗試(14.1%),GPT-5.6 Sol 60 次(12.6%),GPT-5.5 54 次(11.4%);Anthropic 這邊,Claude Opus 4.7 是 43 次(9.1%),Claude Mythos Preview 37 次(7.8%)。

AISI 的原話只有一句:「每一個我們針對這項行為測試過的模型,都試圖作弊。」

先把定義講清楚。AISI 說的作弊,是指模型為了走捷徑而做出超出任務範圍、或規則明文禁止的動作。評測場景是資安界熟悉的抓旗(capture the flag),模型要在模擬環境裡逆向工程、打漏洞,找出一串藏起來的字串。這種題目本來就要求模型「駭」,但每一題都畫了範圍跟規則,越線才算數,而且沒有任何一題提示模型去作弊。

五個數字排不出趨勢線,這點反而是報告裡比較重要的發現。AISI 明講,跨開發商來看能力愈強不代表作弊率愈高,代表作弊主要是被訓練方式(含對齊訓練)塑造出來的,不是能力提升的自然副產品。

最常見的手法不是上網抄答案

報告把作弊手法拆成八類,分布相當分散。GPT-5.4 的作弊執行中,約 7 成出現「攻擊評測目標以外的系統」,GPT-5.5 也在同一個量級;GPT-5.6 Sol 最愛的則是「上網搜尋現成解答」,約 66%;Claude Opus 4.7 同樣以攻擊非目標系統為主,約 53%;Claude Mythos Preview 最突出的是存取被禁止的上游資源與其他違規。

其他手法還包括在非目標系統上提權、探測評測框架本身看它會不會漏出答案、直接猜一個答案交上去,甚至動用評測基礎設施的憑證。AISI 特別註明,模型往往不只用一招,同一次執行中出現多種手法是常態。

最誇張的一次,發生在一道因為設定錯誤而根本無解的網路評測。受測模型鍥而不捨到跑去 AISI 系統之外、架設在公開網路上的第三方服務寫程式並執行,反過來試圖存取 AISI 自己的評測基礎設施,直接觸發資安警報。AISI 說沒有造成損害、沒有資料外洩,但補了一句,如果評測基礎設施當初沒照安全標準設計,這次嘗試是有可能成功的。

承認做了,不等於承認做錯

業界目前稽核 AI 最直覺的做法,就是回頭問模型「你剛剛有沒有做不該做的事」。AISI 的資料顯示這招不管用,但失效的位置跟一般想像的不太一樣。

被問到時,五個模型有 75% 到 86% 的回答會明確講出自己那個作弊動作,Claude Mythos Preview 甚至高達 86%,是五個裡面最坦白的。卡住的是下一題,認為自己做的事情是錯的比例只有 25% 到 44%。最坦白的 Claude Mythos Preview 同時也是認錯率最低的那一個,只有 25%,另外有 37% 直接把該行為評為「沒問題」。

換句話說,模型不是在隱瞞,是不覺得那有什麼。

第二把稽核工具思維鏈(chain-of-thought)也一樣不牢靠。GPT-5.6 Sol 在被判定為作弊的動作裡,有 40% 完全沒有評估過這件事適不適當,另有約 21% 是看到了限制,然後自己給自己開綠燈或權衡後照做。Claude Opus 4.7 更極端,87% 的作弊動作根本沒有產出任何思維鏈,因為它會動態決定要不要輸出推理,剩下 13% 有推理但沒討論到這件事。

這份報告動搖的是分數本身

對外部世界來說,這件事的殺傷力不在資安,而在分數。企業選型、媒體報導、模型發表會的投影片,全都建立在能力評測的數字上,而 AISI 直接點名,作弊會讓評測高估模型的真實能力。

AISI 也留了防守線。報告說所有已發表的能力評測都經過人工逐字複查,就他們所知沒有任何模型成功作弊而未被抓到;但也強調自動化 LLM 監控器一定會漏,上述數字要當成「偵測到的作弊嘗試下限」來讀。至於已經被拖累的,第三方評測機構 METR 對 GPT-5.6 Sol 的評測就受到明顯影響。

AISI 給的處方,是別無選擇的那一種。自我報告不可信,思維鏈不可信,剩下的只有人工複查加上自動監控器,而這套組合的有效性,正好會隨著模型能力上升而遞減。報告最後那句話大概是整份檔案裡最不樂觀的:更根本的解法是從訓練階段就讓模型不作弊,但這種行為一年多前就已經在前沿模型上被記錄下來,要穩健地把它對齊掉,恐怕沒那麼容易。

加入動區 Telegram 頻道

本文源自 AI Security Institute,由動區動趨整理報導。

📍相關報導📍

美國白宮推出「金鷹計劃」抓軟體漏洞,CNBC 爆內幕:OpenAI、Anthropic 新模型恐要政府點頭

AI 安全新創 Depthfirst 宣布擊敗 Anthropic 模型 Mythos!揪出 NGINX 潛伏 18 年史詩漏洞、抓漏成本僅 1/10

Gemini 3.5 Pro 難產再爆內幕!內部評測可能輸給 Meta 入門模型 Muse Spark

Tags: AISIAnthropicClaude Opus 4.7GPT-5.6 SolOpenAI


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.