
LTX-Video:兼具速度與畫質的開源影片生成模型
想要把靜態照片變成影片,過去往往需要專業剪輯軟體與數小時的算圖時間。現在,Lightricks 開發的 LTX-Video 簡化了這個流程,讓文字生成影片(Text-to-Video, T2V)與圖片生成影片(Image-to-Video, I2V)變得更加直觀與高效。
什麼是 LTX-Video?
LTX-Video 是一款採用 Diffusion Transformer (DiT) 架構的開源即時影片生成模型。除了能將靜態影像轉換為動態影片(I2V)之外,它同時原生支援從文字直接生成影片(T2V)。
在技術層面上,LTX-Video 採用了強大的 3D 時空變分自編碼器(ST-VAE),將影片在空間(8x)與時間(8x)維度上進行高效壓縮,並搭配 T5-XXL 文本編碼器。這種設計結合了擴散模型(Diffusion Model)的畫面細膩度與 Transformer 對長序列資料的強大建模能力,能在維持動作連貫性的同時大幅降低計算延遲,甚至實現超越影片播放速率的極速算圖。
選擇適合的模型版本
創作者可根據硬體效能與應用場景選擇適合的模型版本:
- 13B / 2B 旗艦模型:具備高精度的運動控制與細緻的光影呈現,適合對畫質與鏡頭語言有高度要求的創作場景。
- 蒸餾版與輕量化模型:透過模型蒸餾技術(如 4-step / 8-step 蒸餾,或搭配 IC-LoRA 控制),可在極少的採樣步數下生成高質量影片,實現近乎即時預覽(Real-time preview)的互動創作體驗。
如何使用
- 本地腳本執行:技術愛好者與開發者可直接下載 GitHub 上的程式碼庫,透過設定配置文件與 YAML 檔案在本地端直接執行 T2V / I2V 任務。
- ComfyUI 節點整合:習慣使用視覺化工作流的使用者,可安裝官方維護的 ComfyUI-LTXVideo,將模型靈活整合至現有的 ComfyUI 創作流程中。
提示詞與鏡頭控制建議
提示詞(Prompt)與參考圖品質直接決定了輸出的動作流暢度與畫面細節。與其輸入簡單籠統的關鍵字,不如明確描述「鏡頭運動、主體動作、光影變化與材質質感」。例如:
- 不推薦:「深海裡的海浪」
- 推薦:「深藍色的海浪撞擊崎嶇岩石,激起白色泡沫,背景有雲霧繚繞的遠山;鏡頭慢速推近,伴隨劇烈的自然光影變化與高動態範圍質感。」
若進行圖片生成影片(I2V),建議使用高清晰度、邊緣明確且無運動模糊的靜態圖片作為首幀輸入。
常見問題
Q:硬體要求高嗎? A:硬體門檻視模型版本與量化程度而定。全精度 13B 模型對顯存(VRAM)要求較高(建議 24GB 以上 GPU);若硬體資源有限(如 8GB~12GB VRAM 的消費級顯示卡),建議優先採用 2B 版本、FP8/INT8 量化模型或蒸餾版本。
Q:解析度與幀數的設置建議為何? A:由於時空 VAE 壓縮機制的限制:
- 解析度:長與寬建議必須為 32(或 64)的倍數(控制在 1216×704 或 720×1280 以內能獲得最佳速度與品質平衡)。
- 總幀數:建議設定為
8n + 1(例如 9, 17, 25, 33, 41, 49, 97, 121 幀),這是因為時間軸 VAE 執行了 8 倍採樣壓縮加上首幀對齊。
Q:有相關的 Python 開發資源嗎?
A:開發者可直接透過 Hugging Face 的 Diffusers 函式庫 載入 LTXVideoPipeline 或 LTXImageToVideoPipeline,非常便利地將 LTX-Video 整合進現有的 Python AI 工作流程中。
結語
LTX-Video 憑藉其卓越的 DiT 架構與極高的推論效率,顯著降低了高品質動態影片創作的技術與時間門檻。無論是社群媒體短片製作、廣告概念提案,或是數位藝術探索,這款開源工具都為文字與靜態影像賦予了動態的全新生命。

