• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

開源 Qwen3.8-27B 贏 Claude 9 項:輸的全是純推理?數據來自阿里發布

Mickey帽鼠 by Mickey帽鼠
2026-08-15
in AI, 中國
A A
開源 Qwen3.8-27B 贏 Claude 9 項:輸的全是純推理?數據來自阿里發布
36
SHARES
分享至Facebook分享至Twitter

阿里巴巴 8 月 14 日開源 Qwen3.8-27B,270 億參數的原生多模態模型,Apache 2.0 授權,4-bit 量化後約 17GB 顯示記憶體就跑得動。官方模型卡列出的 14 項對比中,它有 9 項贏過 Claude Opus 4.6 Max,但輸掉的 5 項全部集中在純推理與長鏈編碼。所有數字都來自阿里自家發布,目前沒有第三方獨立複現。
(前情提要:阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本)
(背景補充:中國八週連發 5 款 AI 模型,更便宜 token 把美國中段班逼上絕路)

本文目錄

Toggle
  • 贏的是眼睛,輸的是腦袋
  • 17GB 跑得動,不等於 Agent 跑得動
  • 對手選的是 Opus 4.6 Max
重點摘要
  • Qwen3.8-27B 於 8 月 14 日開源,270 億參數稠密多模態架構,Apache 2.0 授權,原生 262K 上下文可外推至 100 萬 tokens。
  • 官方模型卡的 14 項對比中贏 Claude Opus 4.6 Max 9 項,其中 AndroidWorld 領先 19.9 分、MathVision 領先 29.1 分,但 Terminus 落後 5.2 分、GPQA Diamond 落後 2.1 分。
  • 4-bit 量化約佔 14 至 17GB 顯示記憶體,一張 RTX 4090 級別的卡放得下權重,但這個數字不含 KV cache 與多模態元件。

阿里巴巴 8 月 14 日開源 Qwen3.8-27B,270 億參數的稠密原生多模態模型,Apache 2.0 授權,沒有月活或營收門檻。原生支援 262K 上下文,透過 YaRN 可外推到 100 萬 tokens。中國科技媒體當晚就以「家用顯示卡也能跑大模型」為標題出評測文章。

但拆開來看會發現,它跟「一張家用顯示卡就能跑 Opus 級 Agent」還有些現實的差距。

贏的是眼睛,輸的是腦袋

官方模型卡總共列了 17 項評測,其中有 14 項附上 Claude Opus 4.6 Max 的對照分數。逐項比對之後,Qwen3.8-27B 贏 9 項、輸 5 項。

先看贏的部分,領先幅度確實驚人。

  • MathVision(數學視覺推理)94.6 對 65.5,領先 29.1 分
  • CharXiv(圖表理解)90.2 對 66.0,領先 24.2 分
  • AndroidWorld(手機操作)81.9 對 62.0,領先 19.9 分
  • IFBench(指令遵循)79.5 對 62.5,領先 17.0 分
  • OSWorld-Verified(電腦操作)84.3 對 72.7,領先 11.6 分
  • SWE-bench Pro 61.7 對 53.4,領先 8.3 分

再看輸的部分,這 5 項的性質高度一致。Terminus 終端編碼 73.0 對 78.2,落後 5.2 分;NL2Repo-Bench 程式碼生成 42.3 對 47.6,落後 5.3 分;GPQA Diamond 89.2 對 91.3,落後 2.1 分;OmniDocBench 與 RealWorldQA 則是小幅落後 0.3 分與 1.0 分。

把兩張清單並排就看得出結構,Qwen3.8-27B 大勝的全是「看螢幕、讀圖表、按按鈕」這類視覺代理任務,落後的全是純文字推理與多步驟長鏈編碼。這是一個眼睛很好、腦袋稍淺的模型,而這正好符合 270 億參數該有的樣子。用它自動化重複的介面操作會很順手,把整包程式碼交給它做長線重構就不太能信任。

還有,清單裡贏最多的評測之一叫 QwenSWEBench,79.0 對 63.8 領先 15.2 分,而這是阿里自家出的評測。廠商在自己設計的考卷上拿高分,參考價值本來就有限。

這 14 項全部是阿里自己公布的模型卡數字,目前沒有任何第三方獨立複現。動區在 8 月 4 日寫 Qwen3.8-Max 時就用了「自稱」兩個字,這次的情況一樣。

17GB 跑得動,不等於 Agent 跑得動

硬體門檻是這次最實在的賣點,但也最容易被講過頭。

原始 BF16 權重要吃掉約 56GB 顯示記憶體,需要 80GB 等級的卡;FP8 約 28GB,要 48GB 卡;壓到 4-bit 之後落在 14 至 17GB,一張 24GB 的 RTX 4090 放得下,32GB 的 RTX 5090 則有餘裕。「家用顯示卡也能跑」指的是這個狀態。

問題在於 17GB 只算了權重。KV cache、並發的 Agent 工作階段、CUDA graphs、執行期緩衝、多模態元件全都要另外算,而這個模型的原生上下文是 262K。當 Agent 把整包程式碼庫加上十輪工具輸出往上下文裡塞的時候,顯示記憶體需求跟跑對話完全不一樣。

換句話說,「一張消費級顯示卡跑得動這個模型」是真的,「一張消費級顯示卡跑得動這個模型當 Agent」則要看你打算讓它做多長的任務。

對手選的是 Opus 4.6 Max

模型卡挑的對照組是 Claude Opus 4.6 Max。這個選擇本身值得注意,因為 Anthropic 那邊的進度已經往前跑了。Anthropic 在 8 月 14 日發布的風險報告裡揭露,內部還有未發布的 Model 2,表現贏過已經對外服務的 Fable 5,而且報告中拿來當能力躍升參照點的正是「Opus 4.6 到 Mythos Preview」。

模型這次新增的 reasoning_effort 參數也值得一提,分成 xhigh(預設)、medium、low 三檔,讓開發者按任務難度決定要讓它想多久,另有預設開啟的 preserve_thinking 會保留歷史訊息裡的推理內容。這類旋鈕過去多半都在閉源 API 的計費頁面上才看得到,現在直接寫進開源模型卡。

常見問題

Qwen3.8-27B 真的贏過 Claude Opus 嗎?

在阿里官方模型卡列出的 14 項對照中贏 9 項、輸 5 項,贏的集中在視覺代理任務(AndroidWorld 領先 19.9 分),輸的集中在純推理與長鏈編碼(Terminus 落後 5.2 分)。所有數字都由阿里自行公布,尚無第三方複現。

要什麼樣的顯示卡才能在本機跑 Qwen3.8-27B?

4-bit 量化後權重約佔 14 至 17GB,一張 24GB 的 RTX 4090 放得下,32GB 的 RTX 5090 更寬裕。但這不含 KV cache 與多模態元件,長上下文的代理任務實際需求會高出許多。

加入動區 Telegram 頻道

📍相關報導📍

阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本

DeepSeek 開源 Agent 框架 Harness:有什麼特色、值得用嗎?一夜獲近六萬星

輝達開源大進擊:Nemotron 4 上看 1 兆規模,迎戰中國模型

Tags: Apache 2.0Claude OpusQwen3.8-27BSWE-bench Pro阿里巴巴


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.