• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • Account
  • Account
  • BlockTempo Beginner – 動區新手村
  • Change Password
  • Forgot Password?
  • Home 3
  • Login
  • Login
  • Logout
  • Members
  • Password Reset
  • Register
  • Register
  • Reset Password
  • User
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
  • 登入
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本

0xJigglypuff by 0xJigglypuff
2026-08-04
in AI
A A
36
SHARES
分享至Facebook分享至Twitter

阿里巴巴發布新旗艦模型 Qwen3.8-Max,官方自評稱電腦操作測試贏過 GPT-5.6 Sol Max 與 Fable 5,但跑分未經第三方驗證,開源授權條款也還沒公布。真正讓對手緊張的,是它把每百萬 token 的合計成本壓到 Claude Opus 5 的三分之一以下。
(前情提要:Anthropic 控阿里巴巴「非法竊取」Claude:2880 萬次對話、近 2.5 萬假帳號,蒸餾戰火燒進美國議院)
(背景補充:Kimi K3 登頂前端程式碼榜,真人盲測擊敗 Claude Fable 5)

 

阿里巴巴旗下 Qwen 團隊昨夜發布新一代旗艦模型 Qwen3.8-Max,在官方發布貼文中宣稱,這款模型在 OSWorld-Verified(電腦操作代理能力測試,衡量模型能不能像人一樣操作桌面軟體)拿下 86.1 分,高於 GPT-5.6 Sol Max 的 83.2 分、Fable 5 的 85.0 分,也把 Gemini 3.1 Pro 的 76.2 分甩開一大截。

86.1 vs 83.2,阿里巴巴贏了三分。但這份成績單目前只有一個裁判,阿里巴巴自己。

📢Meet Qwen3.8-Max — our most capable model to date.

Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉

Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters:

– Autonomous coding: 10+ days of… pic.twitter.com/e3YFj2hqcT

— Qwen (@Alibaba_Qwen) August 3, 2026

一張自己打出來的成績單

過去一年,主流大型語言模型的競爭路線其實愈來愈分工。OpenAI 的 GPT 系列主攻通用推理與企業生產力;Anthropic 的 Claude 系列專注寫程式與可靠的長文本推理;Google 的 Gemini 押注多模態與網頁原生工作流;月之暗面(Moonshot AI)的 Kimi K3 則靠「前沿效能+開源權重」硬是插了一腳。Qwen3.8-Max 想做的,是把這幾條路線的長處揉進同一個模型,瞄準的不是聊天助理,而是能連續作業好幾天的「自主員工」。

除了 OSWorld-Verified,Qwen 團隊公布的評測表還列出 PaperBench 93.0 分(衡量重現學術論文實驗的能力)、TerminalBench 2.1 拿下 86.6 分、Vision2Web 69.0 分、LVBench 81.8 分、ERQA 77.8 分,數字相當漂亮。問題是,這些分數全部出自阿里巴巴官方自評,尚未經過任何第三方機構獨立覆核,讀者最好把它們當成廠商的自我報告,而不是客觀成績單。

阿里巴巴官方也宣稱,這套模型特別適合長時間自主寫程式、操作桌面軟體完成重複性業務流程、協助研究機構重現實驗,以及在製造、物流等場景把視覺輸入持續餵回規劃迴圈。換句話說,賣點是「能不吃不喝連續上班」,不是「聊天聊得比較聰明」。

Qwen3.8-Max 是一個混合專家架構(MoE)模型,總參數量達 2.4 兆,但推論時只會實際喚醒約 950 億參數。簡單來說就是,模型內部養了一整支專家團隊,但每次回答問題只點名其中一小群人出勤,不用整團動員,藉此在維持能力的同時把運算成本壓低。它建立在 Qwen3.5 架構之上,上下文視窗一口氣拉到 100 萬 token,等於能一次讀完一整本書再回答問題。

定價才是這次真正讓對手緊張的地方。QwenCloud 定價頁列出,海外市場每百萬 token 輸入 2 美元、輸出 6 美元,中國境內則是人民幣 12 元與 36 元,命中隱式快取還能降到 1.5 元。換算下來,Qwen3.8-Max 輸入輸出合計每百萬 token 只要 8 美元,不到 Claude Opus 5(合計 30 美元)的三分之一,也不到 GPT-5.6 Sol 標準模式(合計 35 美元)的四分之一。跑分打平,價格砍半再砍半,這才是阿里巴巴真正想秀的肌肉。

推論成本之所以敏感,是因為自主代理耗費的 token 量遠超過一般聊天。多輪規劃、反覆自我修正的長流程任務,單一工作就可能吃掉數百萬 token;企業一旦同時跑上百、上千個代理,推論費用很快變成營運成本裡最大的一塊。這股壓力已經外溢:OpenAI 上週才調降 GPT-5.6 中低階模型(Terra、Luna)的 API 價格,降幅分別達 20% 與 80%。Qwen3.8-Max 的低價,某種程度是把這場價格戰又往前推了一把。

沒有一場全勝

把評測表攤開看完整版,會發現 Qwen3.8-Max 並非無所不能。在專業軟體工程測試 SWE-Pro 上,拿下最高分的是 OpenAI 的模型;在部分軟體工程評測與 Agents’ Last Exam(測試模型能不能長時間自主完成任務)上,Anthropic 的 Opus 4.8 仍守住領先位置。阿里巴巴官方公布的比較表其實也承認,Qwen3.8-Max 提供的是「均衡」而非「全面最強」的表現組合,這句話本身,已經比多數廠商的公關稿誠實。

更值得留意的是,阿里巴巴宣稱 Qwen3.8-Max 能自主完成長達 10 天以上的軟體專案、重現動輒數千行程式碼的研究論文、進行晶片設計的迭代最佳化,還能靠多模態回饋持續修正計畫。這些示範同樣全部出自公司內部,尚未經過獨立驗證,聽起來像是能力越強,宣稱的規模也跟著越誇張。

開源的但書

阿里巴巴同時預告,下週將在 Hugging Face 與 ModelScope 開源 Qwen3.8-Max 權重,並同步發布較小的 Qwen3.8-27B。若成真,這將是 Qwen「Max」等級旗艦模型首次開放自行部署,等於把原本鎖在 API 後面的頂規模型,第一次交到企業手上自己跑。

但阿里巴巴目前只公布「要開源」,沒公布「用什麼授權開源」。這個空白不是細節,是關鍵。如果套用 Apache 2.0 之類的寬鬆授權,企業可以自由微調、整合進商用產品;如果換成類似月之暗面(Moonshot AI)Kimi K3 的客製授權,開源歸開源,但要求揭露,且以模型即服務(MaaS)形式對外提供者須另外取得商業授權,這份「開源」對企業的實質意義就會大打折扣。在授權條款公布之前,任何想要自建部署的企業,都只能把這次宣布當成有希望、但還沒兌現的空頭支票。

Qwen3.8-Max 選在一個特別擁擠的時間點登場。短短幾週內,月之暗面、OpenAI、Anthropic 都各自端出新招,有人主打推理、有人主打寫程式、有人主打多模態、有人主打自主代理與價格。阿里巴巴這次的組合牌是:跑分打平、價格壓到對手的四分之一、上下文視窗拉滿,外加一句「權重下週見」,籌碼齊全,但每一張都還要靠時間兌現,而不是靠一張自評成績單就能定案。

跑分是廠商自己選的賽道,價格才是市場自己投的票。Qwen3.8-Max 真正的籌碼從來不是贏了誰,而是便宜到讓對手也得跟著降價,這場仗,最後恐怕不是模型打贏,是價格表打贏。

加入動區 Telegram 頻道

📍相關報導📍

第三方評測》Opus 5 智慧指數微勝 Fable 5、成本砍 26%,幻覺率卻突高

ReactBench 評測 AI 程式碼生成代理:GPT-5.6 Sol 以 43.1% 奪魁,主流大模型狂踩 Bug 地雷

AI 經營自動販賣機實驗:Opus 5 靠行賄與設局奪冠,成最會鑽漏洞資本家

Tags: AnthropicOpenAIQwen阿里巴巴


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData
  • 登入

動區動趨 BlockTempo © All Rights Reserved.