
探索 MAGI-2:新一代音視訊統一生成模型預覽
SandAI 團隊在 GitHub 發布了 MAGI-2-preview 推論框架。這是一套採用 Apache-2.0 協議的開源專案,但它並非單純的「影像生成」引擎,而是一款擁有 114B(1140 億)參數的大型音視訊統一生成模型。該模型基於 MagiMoE(混合專家架構) 開發,在推論時每個 Token 僅需激活 6B(60 億)參數,展示了高效率擴展視訊生成模型的新路徑。
核心架構與解析度配置
MAGI-2-preview 專注於生成長度為 10 秒的影音片段(這是目前唯一支援的長度),並且會在生成畫面時同步產生配音,最終透過 ffmpeg 自動將音軌與視訊進行合併(Muxing)。
其生成流程分為兩個關鍵階段:
- 預覽階段(Preview Stage): 使用
magi2_preview模型在低解析度(512x896)下進行去噪(Denoising),此階段預設執行 100 步。 - 精煉階段(Refiner Stage): 使用
magi2_refiner模型將預覽結果提升至 1080p 級別(實際生成解析度為 1088x1920,以符合 VAE 的 16 倍數步長限制,最後可縮放至標準 1080x1920),此階段預設執行 5 步。
由於 1080p 精煉推論的記憶體開銷極大,預覽與精煉模型預設開啟了 roundtrip 卸載模式(Offload Mode),在各自階段結束後會自動在 CPU 與 GPU 間移入移出,因為在單張 80GB 顯存的 GPU 上無法同時容納這兩個模型的激活值與權重。
推論穩定性、再現性與提示詞增強
針對生成模型中常見的結果再現性與隨機性問題,MAGI-2 在代碼庫中引入了重要優化:
- 位元級別一致性(Bit-exact Determinism): 在
inference目錄下加入了 PyTorch Inductor 編譯設定。開發者可透過傳遞--deterministic參數或設置環境變數MAGI2_DETERMINISTIC=1,強制使 MoE 散佈(MoE Scatter)與注意力機制核心(Attention Kernels)達到位元級別的一致性,便於在不同環境下驗證與除錯。 - 結構化提示詞增強(Prompt Enhancement, PE): 模型在訓練時使用了高密度、長結構化的標註。為了避免簡短的手寫提示詞無法充分發揮模型能力,推論管道內建了可選的 PE 機制。它會調用相容 OpenAI 接口的 LLM,將輸入的簡短提示詞重寫為結構化的 JSON 描述(文字轉視訊使用
t2v.md模板,圖像轉視訊使用i2v.md模板),再渲染為 Markdown 傳遞給下游。
容器化與權重部署優化
由於模型權重極為龐大(總計約 307 GB),官方在 Docker 鏡像設計上進行了優化:
- 程式碼與權重分離(Code-free Image): 官方 Docker 鏡像
sandai/magi-2-preview預先編譯並打包了所有複雜的編譯依賴庫(包括需要編譯的MagiAttention與MagiCompiler),但不包含任何模型權重。 - 靈活掛載: 開發者應將 307 GB 的權重下載至主機的
ckpt/目錄中,並在運行 Docker 時透過卷冊掛載(Volume Mount)將其對齊至/workspace/ckpt。此外,可透過MAGI2_CKPT_ROOT環境變數自由指定權重路徑,無須手動修改 JSON 設定檔。
實務指南與常見問題
Q:執行此模型需要什麼樣的硬體配備?
該模型對算力要求極高。官方推薦配置為 8 顆 NVIDIA Hopper 架構 GPU(例如 H100 80GB),並需要安裝 Python 3.12、最新版本的 CUDA Toolkit,以及系統環境變數中必須包含 ffmpeg。如果系統中缺少 ffmpeg,視訊仍會正常產生,但會失去同步生成的音軌。
Q:模型的完整權重結構與組件為何?
完整的 307 GB 權重包含以下高度模組化的組件:
preview/(228 GB):預覽階段的 Transformer 權重。text_encoder/(56 GB):採用了 Qwen3.5-27B 作為文本編碼器。refiner/(14 GB):精煉階段的 Transformer 權重。stable-audio-open-1.0/(5 GB):用於解碼生成音訊潛在變量的 Audio VAE。vae/(3 GB):視訊 VAE,基於 Wan2.2-TI2V-5B。turbo_vae/(2 GB):蒸餾版的 VAE 解碼器(預設開啟,用於加速時間滑動窗口的解碼)。
Q:如何確保生成視訊與音訊的再現性?
請在啟動推論腳本時,啟用 --deterministic 參數。這會犧牲少許推論速度,但能確保在相同的 Seed 下獲得完全一致的輸出。
Q:未來會有更輕量、更快速的版本嗎?
有的。官方表示目前發布的是 Base 基礎版本(需要 100 步預覽 + 5 步精煉去噪)。未來將推出經由步驟蒸餾(Step-distilled)的 MAGI-2 Preview Distilled 版本,屆時將能以極少的去噪步驟完成高畫質影音生成。
結語
MAGI-2-preview 透過先進的 MagiMoE 架構、音視訊雙模態同步生成設計以及靈活的快取卸載機制,展示了開源界在超大規模視訊生成領域的工程實力。如果您想要在本地環境部署並體驗這套前沿框架,可以造訪 Sand.ai 官方部落格 或直接前往 MAGI-2-preview GitHub 專案頁面 與 Hugging Face 權重庫 獲取完整代碼與模型。




