MiniMax 於 8 月 3 日將全模態影片模型 H3 的權重上架 Hugging Face,2K、24fps 影片與立體聲音訊一次生成;在 Artificial Analysis 競技場上,H3 拿下影片編輯榜第一、文生影片榜反超字節跳動 Seedance 2.0,5 秒片段成本 0.7 美元僅為對手 57 折,社群更實測 12GB 消費級顯示卡即可離線執行。本文整理雙方規格、榜單與生成案例對比。
(前情提要:MiniMax 發表全模態模型 H3:圖、影片、聲音一次生成,承諾近日開源)
(背景補充:字節跳動 Seedance 2.5 發布:升級 30 秒影片+50 份參考,推出合規版權模板 首波合作周星馳)
中國 AI 影片賽道在這個夏天正式分裂成兩條路線:字節跳動把 Seedance 鎖進自家 App 與 API 高牆,MiniMax 則選擇把底牌直接攤在桌上。7 月 31 日透過 API 發表全模態影片模型 H3 後,MiniMax 僅隔三天就在 8 月 3 日宣布正式開放權重,模型檔案同步上架 Hugging Face,ComfyUI 當天就合併原生支援。一週之內,第三方量化版、工作流模板、API 聚合平台全數跟上——這種生態擴散速度,正是閉源的 Seedance 給不了的。
33B 全模態架構:文字、影像、影片、聲音讀進同一條上下文
根據官方模型卡,H3 是一顆 33B 引數的稠密 Transformer(其中約 13B 位於推論時毋須載入的 AdaLN 調變分支),核心賣點是「全模態」(omni-modal):文字、影像、影片、音訊被讀進同一條上下文,再一次性生成最長 15 秒、24fps 的影片,並同步輸出 32kHz 立體聲音訊——對白、音效、環境音與畫面同時誕生,而不是先生成無聲影片再靠後製配音對嘴。
單次生成最多可掛 9 張參考圖、3 段參考影片與 3 段參考音訊,支援文生影片(T2VA)、首尾幀控制(FL2VA)與參考生成(Ref2VA)三種模式,涵蓋 21:9 到 9:16 六種畫幅、11 種語言的穩定對白。開源部分為 768p 的 H3-Base 主模型;2K 輸出則靠 API 端的 H3-Regenerate-2K 上取樣模組完成——這也是後文會提到的開源保留項。
對決 Seedance 2.0:三張榜單兩勝一負,價格只要 57 折
Seedance 2.0 是字節跳動今年 2 月發表的旗艦,同樣主打影音聯合生成、多鏡頭角色一致性,並在後續升級中拿到原生 4K、10-bit 色深,馬斯克也曾公開稱讚其進展速度。單看畫質規格,Seedance 依然是紙面最強者之一,但把榜單、價格與可得性攤開,天平明顯在傾斜。
依 Artificial Analysis 影片競技場 8 月初的統計,三張主要榜單呈現「兩勝一負」格局:
| 榜單(含音訊) | 第一名 | MiniMax H3 | Seedance 2.0 |
|---|---|---|---|
| 影片編輯 | MiniMax H3(1,130) | 第 1 名 | 未入榜 |
| 文生影片 | Gemini Omni Flash(1,245) | 第 2 名(1,234) | 第 3 名(1,221) |
| 圖生影片 | Seedance 2.0 720p(1,196) | 第 3 名(1,187) | 第 1 名 |
價格差距則更為直觀:同樣生成 5 秒片段,H3 的 2K 輸出約 0.70 美元,Seedance 2.0 的 720p 輸出因採 token 計費反而要價約 1.22 美元——H3 用更高解析度打出近乎對折的價格;換算到 1080p 級距,第三方估算 H3 每分鐘約 7.8 美元、Seedance 2.0 約 22.45 美元,相差近三倍。
而最關鍵的分野在可得性:Seedance 2.0 曾因好萊塢版權爭議一度急停全球發布,6 月發表的 Seedance 2.5 也維持閉源、繫結自家平台;H3 的權重就躺在 Hugging Face 上,任何開發者今天就能下載微調。值得一提的是,H3 採用的是自訂的「MiniMax H3 Community License」社群授權而非標準開源授權,對特定地區與使用情境設有限制,商用前仍須細讀條款。
生成案例:遊戲過場、一鍵對嘴、電商影片
開源一週以來,官方與社群已累積不少實際案例。官方展示的遊戲過場 Demo 中,H3 一次生成古代水神殿、發光神器、巨型石像守衛與逃脫橋段的完整運鏡,並附帶同步音效:
Build your first game demo with H3 🧑💻🎮 https://t.co/p3c37gQrD3
— Hailuo AI-MiniMax Design (@Hailuo_AI) August 2, 2026
MiniMax 亦宣布 fal 等平台成為 Day 0 合作夥伴,Luma 隨後也在 8 月 6 日把 H3 接入其多模型 Agents 產品。fal 官方整理的 Prompt 指南收錄了 44 支生成範例,涵蓋產品廣告、角色敘事與介面動畫;ComfyUI 官方教學則提供文生影片、圖生影片與參考生成三套現成工作流。
社群端的玩法更具指標性。電商工具 WeShop 展示了「一張產品圖+一支爆款參考影片」的工作流:H3 直接把參考影片的節奏、鏡頭結構與帶貨風格轉移到自家商品上,產出可直接投放 TikTok、Reels 的短影音。對嘴(lip-sync)場景的變化更大——過去需要 TTS、對嘴模型、後製混音的六步驟流程,如今一次 API 呼叫就能輸出人聲與嘴型同步的成片,因為嘴型與聲音本來就是同一次生成的產物。而在本地部署端,量化社群發布的精簡版本將權重壓到 42.5GB,ComfyUI 官方更表示搭配權重解除安裝後,12GB 視訊記憶體的消費級顯示卡即可執行。
「打趴」的另一面:三個保留項
不過,若要說 H3 已全面輾壓 Seedance,仍有三處必須誠實標註。其一,開源版只到 768p,招牌的 2K 輸出依賴未開源的 API 端上取樣模組,本地部署者拿不到完整體驗;其二,在最主流的圖生影片場景,Seedance 2.0 至今仍守住競技場榜首,多鏡頭敘事與複雜物理運動也依舊是位元組的強項,且 Seedance 2.5 已把單次生成拉到原生 30 秒、參考素材上限 50 份,紙面規格反壓 H3 一頭;其三,MiniMax 並未公布任何官方 benchmark,目前所有對比皆來自第三方競技場與社群實測。
換言之,H3 真正「打趴」對手的地方不在單點畫質,而在打法:用開放權重換生態速度、用近乎砍半的價格換取採用量、用消費級硬體門檻把影片生成從雲端 API 拉回本地工作站。這套劇本 MiniMax 已在語言模型 M3 上演練過一次,如今複製到影片賽道。字節跳動手握 Seedance 2.5 的規格優勢與剪映、即夢的分發管道,短期內不會失去高階市場;但當開發者、工作室與獨立創作者的預設工具鏈開始圍繞一顆開源模型生長時,閉源陣營流失的將不只是榜單上的十幾分 Elo。
📍相關報導📍
MiniMax 發表全模態模型 H3:圖、影片、聲音一次生成,承諾近日開源

