阿里巴巴發布新旗艦模型 Qwen3.8-Max,官方自評稱電腦操作測試贏過 GPT-5.6 Sol Max 與 Fable 5,但跑分未經第三方驗證,開源授權條款也還沒公布。真正讓對手緊張的,是它把每百萬 token 的合計成本壓到 Claude Opus 5 的三分之一以下。
(前情提要:Anthropic 控阿里巴巴「非法竊取」Claude:2880 萬次對話、近 2.5 萬假帳號,蒸餾戰火燒進美國議院)
(背景補充:Kimi K3 登頂前端程式碼榜,真人盲測擊敗 Claude Fable 5)
阿里巴巴旗下 Qwen 團隊昨夜發布新一代旗艦模型 Qwen3.8-Max,在官方發布貼文中宣稱,這款模型在 OSWorld-Verified(電腦操作代理能力測試,衡量模型能不能像人一樣操作桌面軟體)拿下 86.1 分,高於 GPT-5.6 Sol Max 的 83.2 分、Fable 5 的 85.0 分,也把 Gemini 3.1 Pro 的 76.2 分甩開一大截。
86.1 vs 83.2,阿里巴巴贏了三分。但這份成績單目前只有一個裁判,阿里巴巴自己。
📢Meet Qwen3.8-Max — our most capable model to date.
Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉
Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters:
– Autonomous coding: 10+ days of… pic.twitter.com/e3YFj2hqcT
— Qwen (@Alibaba_Qwen) August 3, 2026
一張自己打出來的成績單
過去一年,主流大型語言模型的競爭路線其實愈來愈分工。OpenAI 的 GPT 系列主攻通用推理與企業生產力;Anthropic 的 Claude 系列專注寫程式與可靠的長文本推理;Google 的 Gemini 押注多模態與網頁原生工作流;月之暗面(Moonshot AI)的 Kimi K3 則靠「前沿效能+開源權重」硬是插了一腳。Qwen3.8-Max 想做的,是把這幾條路線的長處揉進同一個模型,瞄準的不是聊天助理,而是能連續作業好幾天的「自主員工」。
除了 OSWorld-Verified,Qwen 團隊公布的評測表還列出 PaperBench 93.0 分(衡量重現學術論文實驗的能力)、TerminalBench 2.1 拿下 86.6 分、Vision2Web 69.0 分、LVBench 81.8 分、ERQA 77.8 分,數字相當漂亮。問題是,這些分數全部出自阿里巴巴官方自評,尚未經過任何第三方機構獨立覆核,讀者最好把它們當成廠商的自我報告,而不是客觀成績單。
阿里巴巴官方也宣稱,這套模型特別適合長時間自主寫程式、操作桌面軟體完成重複性業務流程、協助研究機構重現實驗,以及在製造、物流等場景把視覺輸入持續餵回規劃迴圈。換句話說,賣點是「能不吃不喝連續上班」,不是「聊天聊得比較聰明」。
Qwen3.8-Max 是一個混合專家架構(MoE)模型,總參數量達 2.4 兆,但推論時只會實際喚醒約 950 億參數。簡單來說就是,模型內部養了一整支專家團隊,但每次回答問題只點名其中一小群人出勤,不用整團動員,藉此在維持能力的同時把運算成本壓低。它建立在 Qwen3.5 架構之上,上下文視窗一口氣拉到 100 萬 token,等於能一次讀完一整本書再回答問題。
定價才是這次真正讓對手緊張的地方。QwenCloud 定價頁列出,海外市場每百萬 token 輸入 2 美元、輸出 6 美元,中國境內則是人民幣 12 元與 36 元,命中隱式快取還能降到 1.5 元。換算下來,Qwen3.8-Max 輸入輸出合計每百萬 token 只要 8 美元,不到 Claude Opus 5(合計 30 美元)的三分之一,也不到 GPT-5.6 Sol 標準模式(合計 35 美元)的四分之一。跑分打平,價格砍半再砍半,這才是阿里巴巴真正想秀的肌肉。
推論成本之所以敏感,是因為自主代理耗費的 token 量遠超過一般聊天。多輪規劃、反覆自我修正的長流程任務,單一工作就可能吃掉數百萬 token;企業一旦同時跑上百、上千個代理,推論費用很快變成營運成本裡最大的一塊。這股壓力已經外溢:OpenAI 上週才調降 GPT-5.6 中低階模型(Terra、Luna)的 API 價格,降幅分別達 20% 與 80%。Qwen3.8-Max 的低價,某種程度是把這場價格戰又往前推了一把。
沒有一場全勝
把評測表攤開看完整版,會發現 Qwen3.8-Max 並非無所不能。在專業軟體工程測試 SWE-Pro 上,拿下最高分的是 OpenAI 的模型;在部分軟體工程評測與 Agents’ Last Exam(測試模型能不能長時間自主完成任務)上,Anthropic 的 Opus 4.8 仍守住領先位置。阿里巴巴官方公布的比較表其實也承認,Qwen3.8-Max 提供的是「均衡」而非「全面最強」的表現組合,這句話本身,已經比多數廠商的公關稿誠實。
更值得留意的是,阿里巴巴宣稱 Qwen3.8-Max 能自主完成長達 10 天以上的軟體專案、重現動輒數千行程式碼的研究論文、進行晶片設計的迭代最佳化,還能靠多模態回饋持續修正計畫。這些示範同樣全部出自公司內部,尚未經過獨立驗證,聽起來像是能力越強,宣稱的規模也跟著越誇張。
開源的但書
阿里巴巴同時預告,下週將在 Hugging Face 與 ModelScope 開源 Qwen3.8-Max 權重,並同步發布較小的 Qwen3.8-27B。若成真,這將是 Qwen「Max」等級旗艦模型首次開放自行部署,等於把原本鎖在 API 後面的頂規模型,第一次交到企業手上自己跑。
但阿里巴巴目前只公布「要開源」,沒公布「用什麼授權開源」。這個空白不是細節,是關鍵。如果套用 Apache 2.0 之類的寬鬆授權,企業可以自由微調、整合進商用產品;如果換成類似月之暗面(Moonshot AI)Kimi K3 的客製授權,開源歸開源,但要求揭露,且以模型即服務(MaaS)形式對外提供者須另外取得商業授權,這份「開源」對企業的實質意義就會大打折扣。在授權條款公布之前,任何想要自建部署的企業,都只能把這次宣布當成有希望、但還沒兌現的空頭支票。
Qwen3.8-Max 選在一個特別擁擠的時間點登場。短短幾週內,月之暗面、OpenAI、Anthropic 都各自端出新招,有人主打推理、有人主打寫程式、有人主打多模態、有人主打自主代理與價格。阿里巴巴這次的組合牌是:跑分打平、價格壓到對手的四分之一、上下文視窗拉滿,外加一句「權重下週見」,籌碼齊全,但每一張都還要靠時間兌現,而不是靠一張自評成績單就能定案。
跑分是廠商自己選的賽道,價格才是市場自己投的票。Qwen3.8-Max 真正的籌碼從來不是贏了誰,而是便宜到讓對手也得跟著降價,這場仗,最後恐怕不是模型打贏,是價格表打贏。
📍相關報導📍
第三方評測》Opus 5 智慧指數微勝 Fable 5、成本砍 26%,幻覺率卻突高
ReactBench 評測 AI 程式碼生成代理:GPT-5.6 Sol 以 43.1% 奪魁,主流大模型狂踩 Bug 地雷

