美國國家標準與技術研究院(NIST)與英國 AI 安全研究所(UK AISI)今日聯合發布了一份備受矚目的初步評估報告。針對中國新創 Moonshot AI 最新推出的 Kimi K3 模型,測試結果顯示其在漏洞利用與網路攻擊能力上,雖然擊敗了先前的開源王者 GLM-5.2,但整體表現依然「明顯落後」於美國最頂尖的閉源前沿模型。
(前情提要:自託管 AI 模型更省錢?Cline 實測 Kimi K3 成本優勢,網反駁:按任務算比 Fable 5 貴)
(背景補充:擠爆!Kimi K3 上線 48 小時用量達上限,月之暗面暫停新訂閱)
隨著人工智慧模型的能力不斷突破,其在網路安全攻防上的潛力與威脅已成為各國政府的高度國安焦點。台北時間 7 月 23 日,隸屬於美國 NIST 的 AI 標準與創新中心(CAISI)與英國 UK AISI 發布了一項針對中國 Moonshot AI 旗下最新模型 Kimi K3(預計於 7 月 27 日開放權重)的聯合網路安全能力評估報告。這份官方報告的發布,不僅是一次技術實力的檢驗,更是美中兩強在 AI 領域角力的具體展現。
CAISI’s latest blog post evaluates Kimi K3 and its cyber capabilities.
Based on a preliminary cyber-focused evaluation, Kimi K3 performed significantly below the leading U.S. frontier AI models.https://t.co/r9K3Pp0IiH
— U.S. Department of Commerce (@CommerceGov) July 23, 2026
高難度漏洞利用,Kimi K3 掛零
這份初步評估報告首先聚焦於模型的「漏洞利用開發能力」。在名為 ExploitBench 的公開基準測試中,測試人員要求模型針對 41 個 2023 年後的 V8 引擎(Chrome 瀏覽器核心)漏洞進行攻擊演練。結果顯示,Kimi K3 的整體成功率約為 32%,雖然勝過此前最具網路能力的開源模型 GLM-5.2(約 24%),但面臨最高難度挑戰時卻暴露了實力差距。
報告指出,Kimi K3 在這 41 個測試樣本中,完全無法達成最具破壞性的「任意程式碼執行(ACE,Arbitrary Code Execution)」。相較之下,參與測試的頂尖美國模型平均能在約 20 個樣本中成功達成 ACE,展現了輾壓級的漏洞利用能力。
企業網路攻擊模擬:僅走到一半進度
除了單一漏洞利用,評估團隊還透過「The Last Ones(TLO)」基準測試,模擬了一場包含 4 個子網路、約 20 台主機的 32 步企業網路攻擊場景(人類專家約需耗時 20 小時)。
測試數據顯示,Kimi K3 平均只能推進到第 17 步的攻擊進度,而美國最先進的閉源模型平均能完成到第 28.5 步。更殘酷的是,過去只有少數閉源模型能徹底解決 TLO 測試(成功率約 6 至 7 成),而 Kimi K3 在 10 次嘗試中,僅有 1 次能在 1 億個 token 限制內成功走完這 32 步的完整攻擊鏈。
安全防護形同虛設,美商務部發文宣傳
這份報告的另一個重大發現,在於 Kimi K3 內建的系統級安全防護機制(safeguards)顯然不夠嚴謹。測試人員發現,這些防護措施並未能有效阻止該模型協助開發代理式的網路漏洞利用工具,甚至無法擋下其嘗試執行進攻性的網路操作。
報告發布後,美國商務部官方帳號 @CommerceGov 隨即在 X 平台發文,強調「Kimi K3 的表現明顯低於領先的美國前沿 AI 模型」。儘管 Kimi K3 在開源/開放權重模型中已展現出超越 GLM-5.2 的進步,具備一定攻擊弱防護企業系統的能力,但這份由美英官方背書的成績單,無疑是向世界宣告:在最核心、最具破壞力的 AI 網路安全技術上,美國仍穩坐霸主地位。

