MiniMax 發表全模態生成模型 H3 並宣布近日會開源,官方稱 2K 影片生成成本僅同級旗艦的三分之一。
(前情提要:MiniMax M3 正式開源:428B 原生多模態 MoE、1M 超長上下文)
(背景補充:字節跳動 Seedance 2.5 發布:升級 30 秒影片+50 份參考,推出合規版權模板 首波合作周星馳)
繼 6 月開源文字模型 M3 之後,MiniMax 再度出手。今(31)日發布新一代全模態生成模型 H3(海螺 Hailuo 3.0),並宣布近日將開源模型權重。
H3 從「專用任務模型」走向「通用多模態智慧」:不再把生圖、生影片、生聲音、編輯、參考這些功能分開賣,而是讓一個模型在文字、圖片、影片、聲音混合的語境裡,統一理解用戶到底想要什麼。
官方公布的數字很誘人:2K 解析度影片每秒 0.8 元人民幣,一支 15 秒的片子約 12 元人民幣,號稱只要同級旗艦模型三分之一的成本。
MiniMax H3 is on Runway!! 🪄
So excited to bring H3 to @runwayml incredible creative community.
Open weights coming soon… go make something wild 👀#MiniMaxH3 https://t.co/8yErjJZHk6
— MiniMax (official) (@MiniMax_AI) July 31, 2026
這次新模型做了什麼
H3 的輸入端可以吃文字、圖片、音訊、影片,而且能混著給;輸出端是原生 2K 解析度、24 幀,5 到 15 秒、音畫同步,影像跟聲音是同一次生成出來的,不是先出畫面再回頭配音。
它的賣點叫 Omni-Reference 全模態參考:單次生成最多可以帶 9 張參考圖、3 段參考影片、3 段參考音訊,用來指定風格、角色、動作、音色,但這些參考不會被當成必須照抄的關鍵影格,模型有自己的詮釋空間。
功能上,H3 支援文生影片、圖生影片、多鏡頭敘事、指令式編輯,還有 V2V Motion Transfer,也就是把一段影片裡的動作直接搬到另一個角色身上。
官方把應用場景寫得很直白:廣告、品牌行銷、電商、產品設計、UI/UX、遊戲。用詞刻意選了「商業級生產」而非「生成影片」,明顯是說給甲方聽的。
生成效果如何?
不過 MiniMax 自稱拿下第一的是「影片編輯」這個子項目,不是綜合影片生成。
同一份 Artificial Analysis 榜單,截至 7 月,字節跳動今年 2 月發布的 Seedance 2.0 仍以 1,213 Elo 領先含聲音影片榜,圖生影片盲測更以 1,344 Elo 排在首位;Google Veo 3.1 被視為綜合表現最強;快手可靈 Kling 3.0 在 llm-stats 影片競技場則以 2,023 分居冠。
至於開源,目前仍然只是一句「近日」的承諾,權重還沒有真的出現在 Hugging Face 上。H3 是不是真的第一,答案要等權重上架、第三方跑分出爐才算數;現在能確定的,只有 MiniMax 又搶先卡到了一個位置。
📍相關報導📍
MiniMax M3 正式發布:跑分接近 Claude Opus 4.7,但價格只要十分之一

