
探索 MiniMax H3:突破任務與模態邊界的全能生成模型
在多模態生成領域,如何打破不同任務與模態之間的壁壘,一直是研究人員努力的方向。過往的模型通常將「文字轉影片」、「圖像轉影片」或「音訊合成」視為獨立的專門任務,導致創作者難以在複雜的情境中流暢串連這些功能。
MiniMax 推出的 MiniMax H3 則打破了傳統任務與模態的邊界。這款擁有 330 億參數(33B) 的全能(Omni-modal)生成系統,不僅能深度理解結合文字、圖像、影片與音訊的複雜多模態上下文,還能直接生成高達 2K 解析度、長達 15 秒且帶有 32 kHz 原生立體聲(Native Stereo) 的高品質影片,為商業內容創作提供了極具性價比的高效路徑。
核心架構與技術解析
MiniMax H3 在底層設計上貫徹了「架構應服務於任務」的極簡化、通用化哲學,捨棄了過於繁複的模態特定(Modality-specific)結構,轉而採用單一、流暢的端到端訓練管道。
其完整的系統架構由以下三個關鍵模塊緊密協作而成:
1. H3-Context-IR(情境式全能表示法)
當輸入的創作指令與參考媒介變得極其複雜時,傳統模型往往無法準確跟隨。H3 內建了專門的主控預處理與編排系統 —— H3-Context-IR。
- 運作機制: 該系統能深度解析自由格式(Free-form)的多模態輸入,理清文本、多張圖像、參考音軌與驅動影片之間的複雜時序與邏輯關係。例如,使用者可以輸入:「參考影片 1 的鏡頭運動,讓圖像 2 的角色唱歌,且歌聲需與音訊 3 的音色和節奏相匹配。」
- 數據精簡: 該系統會將龐大(高達約 100K tokens)的多模態原始素材,智能提煉並序列化為 H3-Base 能直接理解的結構化中介表示(Context Intermediate Representation),平均壓縮至約 4K tokens。
- 註:由於此預處理系統依賴多個託管服務,並未包含在本次開源權重中,開發者可通過 MiniMax 開放平台 API 呼叫,或依據官方提示指南(Prompting Guidance)自行構建。
2. H3-Base(核心生成底座)
H3-Base 負責根據 H3-Context-IR 序列化後的結構化表示進行影音協同生成,預設輸出解析度的短邊為 768 像素(768p),畫面幀率為 24 FPS。
- H3-Encoder(Qwen3-VL-32B 強力驅動): 文本編碼器直接採用了 Qwen3-VL-32B 的完整預訓練權重,並提取其第 50 層的隱藏狀態(Hidden States)輸入至後續的 Transformer,賦予模型極其強大的複雜指令遵循與排版印刷(Text & Brand Rendering)能力。
- H3-VAE(雙通道編碼):
- 視覺端(H3-VisualVAE): 採用時序因果(Temporally Causal)設計,具備 16 倍空間壓縮與 4 倍時序壓縮率(f16t4d24)。在進入 Transformer 前會被進一步 patchified(1x2x2),使空間實際下採樣達到 32 倍。訓練完畢後,官方更為其額外訓練了一個基於 ViT 的解碼器,以大幅降低推理成本並提升重建畫面邊緣的細節。
- 音訊端(H3-AudioVAE): 使用相同的編碼/解碼器獨立處理左、右聲道,隨後重新合成為立體聲,將 32 kHz 音訊壓縮為 40 Hz 的潛在標記序列。這使得 H3 能夠在不分離人聲、音效或背景音樂的情況下,實現整體的音訊-視訊一體化協同生成。
- H3-Omni-Transformer(33B 稠密單流架構): 採用 33B 參數的稠密、單流(Single-stream)Transformer 共同預測視訊與音訊的潛在變量(Latents)。其中約 13B 參數位於 AdaLN 調製分支中,在純推理部署(Inference-only)時可被預先計算並快取,進一步降低顯存佔用。此外,模型使用了三維多模態旋轉位置編碼(MM-RoPE)來捕捉時間與二維空間位置。
3. H3-Regenerate-2K(情境式本機重生成)
在生成 2K 高畫質影像時,H3 完全摒棄了傳統的超解析度(Super-resolution)插值或外掛放大模組,而是採用了創新的**情境式本機重生成(In-context Regeneration)**技術。
- 技術優勢: 系統會將 768p 的初步生成結果連同最初的多模態上下文再次餵回 H3 基礎模型中,由模型利用自身的生成能力與上下文細節重新描繪。
- 還原細節: 這種方法能最大程度保留並恢復出傳統超解析度工具只能靠「猜測」生成的精細紋理、微小文字與品牌標誌。
- 註:此高級模組目前尚未開源,開發者可暫時通過官方開放平台 API 進行體驗。
模型開放與授權協議
- 完全開源: 與原草稿中「計畫在法規許可的前提下分批公開」的描述不同,MiniMax 目前已正式將 H3-Base 的核心權重完全開源至 Hugging Face(
MiniMaxAI/MiniMax-H3)。 - 開源授權: 該模型以 MiniMax H3 Community License Agreement(社群許可協議) 發布,允許開發者在合規前提下進行本地部署、微調與客製化版本開發。
- 開源規格: 官方提供了兩個針對特定任務蒸餾後的無 CFG(CFG-distilled)模型權重分支:
- MiniMax-H3 Base FL2VA(首尾影格模式):支援無圖像輸入(T2V 模式)、單張圖像輸入(首影格或尾影格生成影片)以及兩張圖像輸入(首尾影格無縫生成影片)。
- MiniMax-H3 Base Ref2VA(全能參考模式):支持超強的多模態參考,最多可接收 9 張圖像、3 段影片(每段 2~15 秒)以及 3 段音軌(最多 12 個參考檔案混合輸入)進行編輯與生成。
快速開發與部署指南
MiniMax H3 已與開源生態深度集成,原生支持 Diffusers 庫、SGLang、vLLM 以及 ComfyUI。
1. 使用 SGLang 進行多卡高吞吐部署
對於企業級推理,官方推薦使用 SGLang 部署(需配置多卡以平衡 heterogeneous 計算負載):
# 部署 FL2VA 模型(首尾影格/純文本轉影音模式)
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4 --performance-mode speed --host 0.0.0.0 --port 30010 --model-variant fl2va
# 部署 Ref2VA 模型(多模態全能參考與編輯模式)
sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4 --performance-mode speed --host 0.0.0.0 --port 30011 --model-variant ref2va
2. 使用 Diffusers 進行快速本地推理
Diffusers 使用者無須手動下載完整的權重目錄,可通過 MiniMaxH3ModularPipeline 原生自動加載相應組件:
import torch
from diffusers import DiffusionPipeline
# 載入 MiniMax-H3,在支持 BF16 的 GPU 上運行 (如 A100/H100)
pipe = DiffusionPipeline.from_pretrained(
"MiniMaxAI/MiniMax-H3",
dtype=torch.bfloat16,
device_map="cuda"
)
# 執行多模態影音協同推理
prompt = "Cinematic slow motion of a futuristic hovercar gliding through a neon-lit cyberpunk alleyway, steam rising from the wet pavement, 2k resolution, detailed."
generated_output = pipe(prompt)
# 影片與立體聲音軌將會被同時生成並保存在 output 中
常見問題
Q:MiniMax H3 支援哪些語言? H3 提供了極為穩定的 11 種主要語言雙向對話支持,包含:中文、英語、日語、韓語、阿拉伯語、法語、德語、義大利語、葡萄牙語、俄語和西班牙語。
Q:如何大幅度提升提示詞跟隨與生成品質?
- 官方強烈建議在推理流程中加入 H3-Context-IR 作為前置預處理系統,將原始創意指令序列化為中介表示。
- 開發者亦可前往官方 GitHub 倉庫參考 Official Skills 提示詞工程寫作指南,利用大語言模型將描述優化為 H3 最易理解的 Shot-by-Shot 與音效場景提示詞。
Q:如何體驗 H3 系統的實際生成效果?
- 網頁免部署體驗: 可前往 Hailuo AI Web (海螺 AI)(國內用戶可使用 hailuoai.com)體驗直觀的影片生成介面。
- 跨平台客戶端: 開發團隊提供了 Desktop App (hub.minimax.io) 供創作者下載。
- 雲端 API 整合: 開發者可至 MiniMax 開放平台 取得 Token,直接呼叫
/video-generation-v2-create、/video-generation-v2-h3-context-ir與/video-generation-v2-regeneration構建完整的 2K 生成管線。
Q:與市面上其他商業模型相比,H3 的成本優勢如何? 得益於 H3-VAE 的高壓縮率與單流 Transformer 架構,H3 實現了極高性價比:在預設的 2K 解析度生成下,其每秒生成成本不到主流商業模型的三分之一;而在 768p 生成下,其成本亦低於主流模型 720p 規格的一半,極具商業化量產可行性。
結語
MiniMax H3 通過將語言視為通用、可擴展的計算系統,將多模態智能深深錨定於自然語言之上。它成功打破了傳統音視頻生成任務的孤島,讓內容創作者能夠用一句自然語言,流暢駕馭視覺、聽覺與鏡頭調度的交響樂章。如果您正計劃構建新一代多媒體創作平台或自動化影音生產管道,可以前往 MiniMax H3 Hugging Face 模型卡 下載權重,解鎖全能生成的新維度。




