
簡介
想像一下,您只需一段影片和音頻,便能生成與之完美同步的虛擬人影像。不論是新聞播報、虛擬主播,還是教育內容,TANGO都能助您輕鬆實現。這項開源技術正引領數位內容創作的未來。
打破傳統的數位分身限制
TANGO結合尖端的圖形檢索技術與擴散模型技術,提供自然流暢的身體動作生成,讓音頻與影像無縫銜接,並徹底消除過去生成模型中常見的畫面失真與動作失調問題。
TANGO的三大創新突破
階層式音頻-動作嵌入空間
- 透過AuMoCLIP技術,TANGO首次實現音頻與動作的深度聯繫。不論是語速、語調還是手勢特徵,都能被精準捕捉,實現跨模態的完美同步。
外觀一致性的擴散插補模型
- 全新ACInterp技術,在動畫生成過程中加入背景與動作參考模塊,確保每一幀畫面都保持自然流暢且與原始風格一致。
高效的動作圖構建與優化
- 利用圖修剪技術,TANGO在無限長度的影片生成中避免動作跳躍與不連續,讓每個過渡動作天衣無縫。
應用場景
- 虛擬主播:打造生動自然的虛擬人進行實時互動或節目主持。
- 教育內容:快速生成與教學語音同步的動畫講師,提高課程吸引力。
- 企業展示:生成專業的商業簡報或產品介紹影片,降低製作成本。

效果對比
在目前公開數據集上,TANGO展現出卓越的性能:
- 視覺質量得分提升33.8%,幾乎可與真實影片媲美。
- 動作與音頻的同步性達到前所未有的高度,超越傳統生成方法(如GAN和關鍵字匹配)。
體驗TANGO的魔力
若是不用HeyGen,可以試試TANGO不僅是開源技術的巔峰,更是未來數位內容創作的希望。
讓您的創作邊界再無限制,TANGO與您共同邁向數位內容創新的未來!
其他連結
體驗 Scribis:打造極致高效的語音與影音工作流程
Scribis 是一款專為創作者、研究員與專業人士打造的全方位 AI 語音工具,結合本地隱私計算與雲端 API 串接,提供毫秒級語音轉文字、語音合成與動態時間軸編輯功能。
高精準語音轉文字 (ASR)
整合 Whisper、Breeze ASR、SenseVoice、Parakeet、Qwen、VibeVoice 與 Voxtral 本地模型,並支援 ElevenLabs Scribe v2、Groq、Gemini 3.5 Transcribe 等雲端 API 一鍵調用。
高自然度文字轉語音 (TTS)
支援 Kokoro TTS、Qwen 3 TTS 以及自研研發的語音合成模型,輕鬆將文字轉換為極具渲染力的語音與配音。
動態時間軸與字幕編輯器
提供毫秒級影音與字幕對齊,支援雙語字幕同屏顯示、專業詞典替換與 AI 語法自動校正修正。
隱私優先與靈活 API 串接
支援 100% 本地離線推論保護數據隱私,同時可彈性輸入自訂 API Key 自由切換全球雲端 AI 模型。

videoweaver.app
Video Weaver: 瀏覽器內完成專業影片剪輯,無需下載、即刻創作。
Learn More
scribis.app
Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。
Learn More
DMflow.chat
DMflow.chat: 您的智能AI夥伴,提升客戶互動、創造卓越體驗。
Learn More
DMflow.chat
探索DMflow.chat,立即開啟AI驅動的客戶服務新時代。
Learn More
videoweaver.app
Video Weaver: 瀏覽器內完成專業影片剪輯,無需下載、即刻創作。
Learn More
scribis.app
Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。
Learn More
DMflow.chat
DMflow.chat: 您的智能AI夥伴,提升客戶互動、創造卓越體驗。
Learn More
DMflow.chat
探索DMflow.chat,立即開啟AI驅動的客戶服務新時代。
Learn MoreRecommended for You
Mage-VL:微軟推出高效能 codec-native 串流多模態模型,影音處理速度提升 3.5 倍
揭開 Mage-VL 的面紗:以編解碼器思維處理多模態資料 在人工智慧領域,我們常面臨一種現代版的「莫拉維克悖論(Moravec’s paradox)」:強大的多模態模型(VLM)雖然極其擅長複雜的離線推理,但在面對需要即時、低延遲的影音串流(Streaming)處理時,往往顯得反應遲鈍且耗費極高算力。 為了打破這個瓶頸,微軟推出了 Mage-VL(arXiv: 2607.24904)。這是一款主打**編解碼器原生、主動式串流(Codec-native, Proactive-streaming)**的多模態基礎模型。其總參數規模為 5B,核心優勢在於將影片壓縮標準與影片理解深度融合,能對即時影音串流進行極致高效且具主動性的處理。 圖片來源: microsoft/Mage-VL · Hugging Face 為什麼要「編解碼器原生」? 傳統的影片多模態模型在處理影片時,通常將其拆解為均勻採樣的影格,再將海量的 16×16 影像塊(patches)送入凍結的、預訓練視覺編碼器。這種做法會產生極大的計算冗餘,因為相鄰影格間通常包含大量重複的靜態背景。 Mage-VL 則完全模仿現代影片編碼器(如 H.264/AVC、HEVC/H.265 或神經編碼器 DCVC-RT)的壓縮邏輯,將影片串流拆分為: 關鍵幀(I-frames/Anchor frames):模型會完整保留其視覺圖像。 預測幀(P-frames/Predicted frames):模型只保留編碼器實際「花費位元(spending bits)」記錄動作變化與新細節的運動顯著區域。 這種與編解碼器對齊的預測性塊保留機制(Predictive-patch mechanism),能將視覺令牌(Visual Tokens)的消耗減少 75% 以上(降至 dense 均勻採樣的 1/8 甚至更低)。在完全不丟失時空上下文與定位精度的前提下,這項設計帶來了高達 3.5 倍的牆鐘推理速度提升(Wall-clock inference speedup)。 圖片來源: Mage-VL Mage-ViT:資料高效的從零預訓練視覺大腦 Mage-VL 的視覺處理核心是 Mage-ViT(Codec-ViT)。與目前市面上依賴數十億、甚至上百億圖像-文本對初始化權重的 VLM 前端不同,Mage-ViT 展現了極高的資料效率: 無須海量標註資料:它是在僅有 約 1 億張(100M)未標記的圖像與影片影格 上,透過集群判別(Cluster-discrimination)從零開始(from scratch)預訓練而成。 強悍的零樣本表現:其在 CIFAR-10 上取得了 99.33%、在 ImageNet 上取得了 85.69%(僅使用 256 tokens)的驚人成績,實力媲美甚至超越了使用數十億大數據集訓練的 SigLIP2 (10B params) 或 MoonViT (2B params)。 原生解析度單調擴展:支援可變解析度預訓練。隨著令牌預算(Token budget)的增加(最高達 676 tokens),其表現能持續單調提升(ImageNet 達到 86.3%、Food-101 達到 96.1%),解決了傳統固定解析度編碼器在 token 增加時性能飽和或退化的通病。 解碼器相容(Codec-agnostic):Mage-ViT 具有通用的前端介面,無須修改架構或重新訓練,即可直接接收傳統編解碼器(透過運動向量與殘差能量)或神經編解碼器(透過 Rate map)。 雙處理系統:實現主動式低延遲串流 Mage-VL 引入了生物學啟發的「系統 1 與系統 2」雙處理機制,在單一權重模型內實現了主動式串流(Proactive streaming),無須維護複雜的多 Agent 管道:
MiniMax H3 全能多模態生成模型:震撼推出,影音生成與 2K 解析度新巔峰
探索 MiniMax H3:突破任務與模態邊界的全能生成模型 在多模態生成領域,如何打破不同任務與模態之間的壁壘,一直是研究人員努力的方向。過往的模型通常將「文字轉影片」、「圖像轉影片」或「音訊合成」視為獨立的專門任務,導致創作者難以在複雜的情境中流暢串連這些功能。 MiniMax 推出的 MiniMax H3 則打破了傳統任務與模態的邊界。這款擁有 330 億參數(33B) 的全能(Omni-modal)生成系統,不僅能深度理解結合文字、圖像、影片與音訊的複雜多模態上下文,還能直接生成高達 2K 解析度、長達 15 秒且帶有 32 kHz 原生立體聲(Native Stereo) 的高品質影片,為商業內容創作提供了極具性價比的高效路徑。 圖片來源: MiniMaxAI/MiniMax-H3 · Hugging Face 核心架構與技術解析 MiniMax H3 在底層設計上貫徹了「架構應服務於任務」的極簡化、通用化哲學,捨棄了過於繁複的模態特定(Modality-specific)結構,轉而採用單一、流暢的端到端訓練管道。 其完整的系統架構由以下三個關鍵模塊緊密協作而成: 1. H3-Context-IR(情境式全能表示法) 當輸入的創作指令與參考媒介變得極其複雜時,傳統模型往往無法準確跟隨。H3 內建了專門的主控預處理與編排系統 —— H3-Context-IR。 運作機制: 該系統能深度解析自由格式(Free-form)的多模態輸入,理清文本、多張圖像、參考音軌與驅動影片之間的複雜時序與邏輯關係。例如,使用者可以輸入:「參考影片 1 的鏡頭運動,讓圖像 2 的角色唱歌,且歌聲需與音訊 3 的音色和節奏相匹配。」 數據精簡: 該系統會將龐大(高達約 100K tokens)的多模態原始素材,智能提煉並序列化為 H3-Base 能直接理解的結構化中介表示(Context Intermediate Representation),平均壓縮至約 4K tokens。 註:由於此預處理系統依賴多個託管服務,並未包含在本次開源權重中,開發者可通過 MiniMax 開放平台 API 呼叫,或依據官方提示指南(Prompting Guidance)自行構建。 2. H3-Base(核心生成底座) H3-Base 負責根據 H3-Context-IR 序列化後的結構化表示進行影音協同生成,預設輸出解析度的短邊為 768 像素(768p),畫面幀率為 24 FPS。
Sand.ai 發布 MAGI-2 預覽版:高效能生成式 AI 影片模型登場
探索 MAGI-2:新一代音視訊統一生成模型預覽 SandAI 團隊在 GitHub 發布了 MAGI-2-preview 推論框架。這是一套採用 Apache-2.0 協議的開源專案,但它並非單純的「影像生成」引擎,而是一款擁有 114B(1140 億)參數的大型音視訊統一生成模型。該模型基於 MagiMoE(混合專家架構) 開發,在推論時每個 Token 僅需激活 6B(60 億)參數,展示了高效率擴展視訊生成模型的新路徑。 圖片來源: Sand.ai - Advance AI to benefit everyone 核心架構與解析度配置 MAGI-2-preview 專注於生成長度為 10 秒的影音片段(這是目前唯一支援的長度),並且會在生成畫面時同步產生配音,最終透過 ffmpeg 自動將音軌與視訊進行合併(Muxing)。 其生成流程分為兩個關鍵階段: 預覽階段(Preview Stage): 使用 magi2_preview 模型在低解析度(512x896)下進行去噪(Denoising),此階段預設執行 100 步。 精煉階段(Refiner Stage): 使用 magi2_refiner 模型將預覽結果提升至 1080p 級別(實際生成解析度為 1088x1920,以符合 VAE 的 16 倍數步長限制,最後可縮放至標準 1080x1920),此階段預設執行 5 步。 由於 1080p 精煉推論的記憶體開銷極大,預覽與精煉模型預設開啟了 roundtrip 卸載模式(Offload Mode),在各自階段結束後會自動在 CPU 與 GPU 間移入移出,因為在單張 80GB 顯存的 GPU 上無法同時容納這兩個模型的激活值與權重。 推論穩定性、再現性與提示詞增強 針對生成模型中常見的結果再現性與隨機性問題,MAGI-2 在代碼庫中引入了重要優化: