
Mage-VL:微軟推出高效能 codec-native 串流多模態模型,影音處理速度提升 3.5 倍
揭開 Mage-VL 的面紗:以編解碼器思維處理多模態資料 在人工智慧領域,我們常面臨一種現代版的「莫拉維克悖論(Moravec’s paradox)」:強大的多模態模 …
Read More →

揭開 Mage-VL 的面紗:以編解碼器思維處理多模態資料 在人工智慧領域,我們常面臨一種現代版的「莫拉維克悖論(Moravec’s paradox)」:強大的多模態模 …

探索 MiniMax H3:突破任務與模態邊界的全能生成模型 在多模態生成領域,如何打破不同任務與模態之間的壁壘,一直是研究人員努力的方向。過往的模型通常將「文字轉影片」、「圖像轉 …

探索 MAGI-2:新一代音視訊統一生成模型預覽 SandAI 團隊在 GitHub 發布了 MAGI-2-preview 推論框架。這是一套採用 Apache-2.0 協議的開源 …


讓靜態影像動起來:Wan-Animate-2 角色動畫框架解析 如果你曾看著精美的角色插畫,想著它能動起來該有多好,Wan-Animate-2 或許能解決你的需求。這套動畫框架免去 …

探索 LTX-2.5:影音生成的新開源選項 LTX-2.5 是近期影音生成領域最受矚目的開源世界模型(world model)。它並非單純的技術迭代,而是為創作者提供了一個可在本地 …
解析字節跳動開源影片 AI 模型 Bernini:MLLM 與 DiT 的巧妙分工架構 影片生成的技術邏輯正在發生有趣的轉變。你知道嗎?過去的影片模型通常會將理解指令與生成畫面混合 …

超越主流商業系統的開源震撼彈:美團 LongCat-Video-Avatar 1.5 數位人框架全面解析 虛擬主播與數位人技術正以驚人的速度走入大眾的視野。從社群媒體上的短影音,到 …
探索 Lightricks 最新推出的 LTX-2 模型,這款基於 DiT 架構的開源工具不僅能生成高畫質影片,還能同步產出音效。本文深入解析其技術規格、ComfyUI 整合方式 …
探索美團最新發表的AI影片生成模型 LongCat-Video。它不僅是一個統一框架,能處理文生影片、圖生影片等多種任務,更擅長生成長達數分鐘的高品質影片,向「世界模型」邁出重要 …

AI 影片生成領域迎來全新突破!字節跳動(ByteDance)正式開源其創新的 Video-As-Prompt (VAP) 模型。這項技術允許使用者直接用一段參考影片作為「提 …
© 2026 Communeify. All rights reserved.