阿里巴巴 8 月 14 日開源 Qwen3.8-27B,270 億參數的原生多模態模型,Apache 2.0 授權,4-bit 量化後約 17GB 顯示記憶體就跑得動。官方模型卡列出的 14 項對比中,它有 9 項贏過 Claude Opus 4.6 Max,但輸掉的 5 項全部集中在純推理與長鏈編碼。所有數字都來自阿里自家發布,目前沒有第三方獨立複現。
(前情提要:阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本)
(背景補充:中國八週連發 5 款 AI 模型,更便宜 token 把美國中段班逼上絕路)
重點摘要
- Qwen3.8-27B 於 8 月 14 日開源,270 億參數稠密多模態架構,Apache 2.0 授權,原生 262K 上下文可外推至 100 萬 tokens。
- 官方模型卡的 14 項對比中贏 Claude Opus 4.6 Max 9 項,其中 AndroidWorld 領先 19.9 分、MathVision 領先 29.1 分,但 Terminus 落後 5.2 分、GPQA Diamond 落後 2.1 分。
- 4-bit 量化約佔 14 至 17GB 顯示記憶體,一張 RTX 4090 級別的卡放得下權重,但這個數字不含 KV cache 與多模態元件。
阿里巴巴 8 月 14 日開源 Qwen3.8-27B,270 億參數的稠密原生多模態模型,Apache 2.0 授權,沒有月活或營收門檻。原生支援 262K 上下文,透過 YaRN 可外推到 100 萬 tokens。中國科技媒體當晚就以「家用顯示卡也能跑大模型」為標題出評測文章。
但拆開來看會發現,它跟「一張家用顯示卡就能跑 Opus 級 Agent」還有些現實的差距。
贏的是眼睛,輸的是腦袋
官方模型卡總共列了 17 項評測,其中有 14 項附上 Claude Opus 4.6 Max 的對照分數。逐項比對之後,Qwen3.8-27B 贏 9 項、輸 5 項。
先看贏的部分,領先幅度確實驚人。
- MathVision(數學視覺推理)94.6 對 65.5,領先 29.1 分
- CharXiv(圖表理解)90.2 對 66.0,領先 24.2 分
- AndroidWorld(手機操作)81.9 對 62.0,領先 19.9 分
- IFBench(指令遵循)79.5 對 62.5,領先 17.0 分
- OSWorld-Verified(電腦操作)84.3 對 72.7,領先 11.6 分
- SWE-bench Pro 61.7 對 53.4,領先 8.3 分
再看輸的部分,這 5 項的性質高度一致。Terminus 終端編碼 73.0 對 78.2,落後 5.2 分;NL2Repo-Bench 程式碼生成 42.3 對 47.6,落後 5.3 分;GPQA Diamond 89.2 對 91.3,落後 2.1 分;OmniDocBench 與 RealWorldQA 則是小幅落後 0.3 分與 1.0 分。
把兩張清單並排就看得出結構,Qwen3.8-27B 大勝的全是「看螢幕、讀圖表、按按鈕」這類視覺代理任務,落後的全是純文字推理與多步驟長鏈編碼。這是一個眼睛很好、腦袋稍淺的模型,而這正好符合 270 億參數該有的樣子。用它自動化重複的介面操作會很順手,把整包程式碼交給它做長線重構就不太能信任。
還有,清單裡贏最多的評測之一叫 QwenSWEBench,79.0 對 63.8 領先 15.2 分,而這是阿里自家出的評測。廠商在自己設計的考卷上拿高分,參考價值本來就有限。
這 14 項全部是阿里自己公布的模型卡數字,目前沒有任何第三方獨立複現。動區在 8 月 4 日寫 Qwen3.8-Max 時就用了「自稱」兩個字,這次的情況一樣。
17GB 跑得動,不等於 Agent 跑得動
硬體門檻是這次最實在的賣點,但也最容易被講過頭。
原始 BF16 權重要吃掉約 56GB 顯示記憶體,需要 80GB 等級的卡;FP8 約 28GB,要 48GB 卡;壓到 4-bit 之後落在 14 至 17GB,一張 24GB 的 RTX 4090 放得下,32GB 的 RTX 5090 則有餘裕。「家用顯示卡也能跑」指的是這個狀態。
問題在於 17GB 只算了權重。KV cache、並發的 Agent 工作階段、CUDA graphs、執行期緩衝、多模態元件全都要另外算,而這個模型的原生上下文是 262K。當 Agent 把整包程式碼庫加上十輪工具輸出往上下文裡塞的時候,顯示記憶體需求跟跑對話完全不一樣。
換句話說,「一張消費級顯示卡跑得動這個模型」是真的,「一張消費級顯示卡跑得動這個模型當 Agent」則要看你打算讓它做多長的任務。
對手選的是 Opus 4.6 Max
模型卡挑的對照組是 Claude Opus 4.6 Max。這個選擇本身值得注意,因為 Anthropic 那邊的進度已經往前跑了。Anthropic 在 8 月 14 日發布的風險報告裡揭露,內部還有未發布的 Model 2,表現贏過已經對外服務的 Fable 5,而且報告中拿來當能力躍升參照點的正是「Opus 4.6 到 Mythos Preview」。
模型這次新增的 reasoning_effort 參數也值得一提,分成 xhigh(預設)、medium、low 三檔,讓開發者按任務難度決定要讓它想多久,另有預設開啟的 preserve_thinking 會保留歷史訊息裡的推理內容。這類旋鈕過去多半都在閉源 API 的計費頁面上才看得到,現在直接寫進開源模型卡。
常見問題
Qwen3.8-27B 真的贏過 Claude Opus 嗎?
在阿里官方模型卡列出的 14 項對照中贏 9 項、輸 5 項,贏的集中在視覺代理任務(AndroidWorld 領先 19.9 分),輸的集中在純推理與長鏈編碼(Terminus 落後 5.2 分)。所有數字都由阿里自行公布,尚無第三方複現。
要什麼樣的顯示卡才能在本機跑 Qwen3.8-27B?
4-bit 量化後權重約佔 14 至 17GB,一張 24GB 的 RTX 4090 放得下,32GB 的 RTX 5090 更寬裕。但這不含 KV cache 與多模態元件,長上下文的代理任務實際需求會高出許多。

📍相關報導📍
阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本
