tool

Sand.ai 發布 MAGI-2 預覽版:高效能生成式 AI 影片模型登場

August 13, 2026
Updated Aug 13
2 min read
Sand.ai 發布 MAGI-2 預覽版:高效能生成式 AI 影片模型登場

探索 MAGI-2:新一代音視訊統一生成模型預覽

SandAI 團隊在 GitHub 發布了 MAGI-2-preview 推論框架。這是一套採用 Apache-2.0 協議的開源專案,但它並非單純的「影像生成」引擎,而是一款擁有 114B(1140 億)參數的大型音視訊統一生成模型。該模型基於 MagiMoE(混合專家架構) 開發,在推論時每個 Token 僅需激活 6B(60 億)參數,展示了高效率擴展視訊生成模型的新路徑。

圖片來源: Sand.ai - Advance AI to benefit everyone


核心架構與解析度配置

MAGI-2-preview 專注於生成長度為 10 秒的影音片段(這是目前唯一支援的長度),並且會在生成畫面時同步產生配音,最終透過 ffmpeg 自動將音軌與視訊進行合併(Muxing)。

其生成流程分為兩個關鍵階段:

  1. 預覽階段(Preview Stage): 使用 magi2_preview 模型在低解析度(512x896)下進行去噪(Denoising),此階段預設執行 100 步。
  2. 精煉階段(Refiner Stage): 使用 magi2_refiner 模型將預覽結果提升至 1080p 級別(實際生成解析度為 1088x1920,以符合 VAE 的 16 倍數步長限制,最後可縮放至標準 1080x1920),此階段預設執行 5 步。

由於 1080p 精煉推論的記憶體開銷極大,預覽與精煉模型預設開啟了 roundtrip 卸載模式(Offload Mode),在各自階段結束後會自動在 CPU 與 GPU 間移入移出,因為在單張 80GB 顯存的 GPU 上無法同時容納這兩個模型的激活值與權重。


推論穩定性、再現性與提示詞增強

針對生成模型中常見的結果再現性與隨機性問題,MAGI-2 在代碼庫中引入了重要優化:

  • 位元級別一致性(Bit-exact Determinism):inference 目錄下加入了 PyTorch Inductor 編譯設定。開發者可透過傳遞 --deterministic 參數或設置環境變數 MAGI2_DETERMINISTIC=1,強制使 MoE 散佈(MoE Scatter)與注意力機制核心(Attention Kernels)達到位元級別的一致性,便於在不同環境下驗證與除錯。
  • 結構化提示詞增強(Prompt Enhancement, PE): 模型在訓練時使用了高密度、長結構化的標註。為了避免簡短的手寫提示詞無法充分發揮模型能力,推論管道內建了可選的 PE 機制。它會調用相容 OpenAI 接口的 LLM,將輸入的簡短提示詞重寫為結構化的 JSON 描述(文字轉視訊使用 t2v.md 模板,圖像轉視訊使用 i2v.md 模板),再渲染為 Markdown 傳遞給下游。

容器化與權重部署優化

由於模型權重極為龐大(總計約 307 GB),官方在 Docker 鏡像設計上進行了優化:

  • 程式碼與權重分離(Code-free Image): 官方 Docker 鏡像 sandai/magi-2-preview 預先編譯並打包了所有複雜的編譯依賴庫(包括需要編譯的 MagiAttentionMagiCompiler),但不包含任何模型權重。
  • 靈活掛載: 開發者應將 307 GB 的權重下載至主機的 ckpt/ 目錄中,並在運行 Docker 時透過卷冊掛載(Volume Mount)將其對齊至 /workspace/ckpt。此外,可透過 MAGI2_CKPT_ROOT 環境變數自由指定權重路徑,無須手動修改 JSON 設定檔。

實務指南與常見問題

Q:執行此模型需要什麼樣的硬體配備?

該模型對算力要求極高。官方推薦配置為 8 顆 NVIDIA Hopper 架構 GPU(例如 H100 80GB),並需要安裝 Python 3.12、最新版本的 CUDA Toolkit,以及系統環境變數中必須包含 ffmpeg。如果系統中缺少 ffmpeg,視訊仍會正常產生,但會失去同步生成的音軌。

Q:模型的完整權重結構與組件為何?

完整的 307 GB 權重包含以下高度模組化的組件:

  • preview/ (228 GB):預覽階段的 Transformer 權重。
  • text_encoder/ (56 GB):採用了 Qwen3.5-27B 作為文本編碼器。
  • refiner/ (14 GB):精煉階段的 Transformer 權重。
  • stable-audio-open-1.0/ (5 GB):用於解碼生成音訊潛在變量的 Audio VAE。
  • vae/ (3 GB):視訊 VAE,基於 Wan2.2-TI2V-5B
  • turbo_vae/ (2 GB):蒸餾版的 VAE 解碼器(預設開啟,用於加速時間滑動窗口的解碼)。

Q:如何確保生成視訊與音訊的再現性?

請在啟動推論腳本時,啟用 --deterministic 參數。這會犧牲少許推論速度,但能確保在相同的 Seed 下獲得完全一致的輸出。

Q:未來會有更輕量、更快速的版本嗎?

有的。官方表示目前發布的是 Base 基礎版本(需要 100 步預覽 + 5 步精煉去噪)。未來將推出經由步驟蒸餾(Step-distilled)的 MAGI-2 Preview Distilled 版本,屆時將能以極少的去噪步驟完成高畫質影音生成。


結語

MAGI-2-preview 透過先進的 MagiMoE 架構、音視訊雙模態同步生成設計以及靈活的快取卸載機制,展示了開源界在超大規模視訊生成領域的工程實力。如果您想要在本地環境部署並體驗這套前沿框架,可以造訪 Sand.ai 官方部落格 或直接前往 MAGI-2-preview GitHub 專案頁面Hugging Face 權重庫 獲取完整代碼與模型。


GitHub - SandAI-org/MAGI-2-preview: MAGI-2-preview: Scaling Video Generation Models Efficiently · GitHub

圖片來源: GitHub - SandAI-org/MAGI-2-preview: MAGI-2-preview: Scaling Video Generation Models Efficiently · GitHub

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.