人工智慧的「代理(Agent)」大戰再度升溫!據 xAI 官方於 12 日發布的最新公告,全新升級的 AI 模型 Grok 4.6 正式問世。這款建構於 Grok 4.5 基礎上的新一代模型,特別針對長時間運行的 AI 代理與複雜視覺化任務進行了深度強化。其不僅在多項寫碼與知識基準測試中展現前沿水準,綜合評分更直接追平了強敵 GPT-5.6 Sol,展現出 xAI 挑戰業界霸主的強大野心。
(前情提要:馬斯克 Grok Bot 公測上線:24 小時不停工的 AI 同事,值得從 Claude、Codex 跳槽嗎?)
(背景補充:摩根士丹利:SpaceX 若跌到 100 美元,等於把 Grok、Cursor 的 AI 價值算成零)
由科技狂人馬斯克(Elon Musk)領軍的 xAI,再次為人工智慧領域投下震撼彈。台北時間 8 月 12 日,xAI 官方正式發布了《Introducing Grok 4.6》公告,宣布推出其最新一代的 AI 模型。Grok 4.6 是在 Grok 4.5 的基礎上進行了全面進化,此次升級的核心焦點,直指當前 AI 發展的最前沿 —— 長時間運行的代理(Agents)以及更具野心的互動式與視覺化工作。
強化模型訓練,完美轉化創意為應用程式
為了賦予 Grok 4.6 處理多步驟複雜任務的能力,xAI 在訓練階段下足了功夫。根據公告,Grok 4.6 進行了比前代更長時間的補充訓練,運用了涵蓋推理與進階技術概念的精心篩選資料,並結合高品質的工程數據與改進的優化器。隨後,團隊更廣泛應用了代理式強化學習(Agentic RL)技術,使其在一般程式碼撰寫、網頁開發,甚至是電腦輔助設計等特定領域中如魚得水。
xAI 強調,Grok 4.6 在將廣泛的產品想法轉化為可用的「第一版原型」方面表現得特別出色。它不僅能自主研究陌生領域、規劃應用程式結構、實作核心互動,還能透過多輪回饋來持續優化工作成果。在較長的任務軌跡中,該模型展現了更多自我測試與驗證的行為,且其視覺與互動專案的建構品質也顯著超越了 Grok 4.5。
基準測試亮眼,綜合實力匹敵 GPT-5.6
在實際能力的數據驗證上,Grok 4.6 繳出了極為亮眼的成績單。根據官方公布的基準測試比較,Grok 4.6 在彙整了九項基準的 Artificial Analysis Intelligence Index(綜合分數)上取得了 61 分,成功與 OpenAI 的 GPT-5.6 Sol Max 打成平手。
此外,在多項專注於開發者與代理能力的測試中,Grok 4.6 同樣名列前茅。例如,在 CursorBench v3.2 測試中達到了 69.9%,在 DeepSWE v1.1 取得 65.9%,而在 APEX-Agents 測試中也獲得了 57.5% 的高分,充分證明其在軟體工程與知識工作領域的頂尖實力。
定價極具競爭力,首週加碼雙倍用量
在安全防護機制經過廣泛校準與測試後,Grok 4.6 現已全面投入市場部署。即日起,開發者已可在知名 AI 編輯器 Cursor 與官方的 Grok Build 平台上直接使用該模型;同時也支援 API 存取,並結盟了 OpenRouter、Vercel、Cloudflare 等重要生態合作夥伴。
在定價策略上,xAI 開出了每 100 萬枚輸入代幣(Input tokens)2 美元、每 100 萬枚輸出代幣(Output tokens)6 美元的極具競爭力價格(另提供價格為兩倍的快速版本)。為了鼓勵用戶盡速體驗其強大的代理能力,官方更祭出了首週在 Grok Build 與 Cursor 提供「2 倍包含用量」的限時優惠,正式向全球開發者發出體驗邀請。

📍相關報導📍
馬斯克放話:Grok 4.6 兩週後上線、4.7 四週後上線,2 兆引數硬碰 Kimi K3
馬斯克宣布開源 Grok Build 開發者能本地編譯,外洩風暴後滅火?
