TOOL FIELD NOTE

Qwen-Image-2.1:7B 影像生成與編輯模型

Qwen-Image-2.1:輕量化視覺模型 對於開發者與創作者而言,要在影像品質與運算效率之間取得平衡並不容易。Qwen 團隊推出的 Qwen-Image-2.1 是一個統一的開源影像模型,將文字生成影像(Text-to-Image)與影像編輯(Image Editing)整合在同一架構中。其視覺生成元件為 70 億參數(7B),並支援透明背景與多參考圖編輯。 輕量化架構設計 Qwen-Image-2.1 採用 32 層單流 DiT(Single-Stream Diffusion Transformer)結構,並 …

PUBLISHED 2026.09.25
READING TIME 1 MIN
UPDATED 2026.09.25
01

COMMUNEIFY
EDITORIAL

把複雜的技術,整理成值得慢慢讀完的內容。

Qwen-Image-2.1:輕量化視覺模型

對於開發者與創作者而言,要在影像品質與運算效率之間取得平衡並不容易。Qwen 團隊推出的 Qwen-Image-2.1 是一個統一的開源影像模型,將文字生成影像(Text-to-Image)與影像編輯(Image Editing)整合在同一架構中。其視覺生成元件為 70 億參數(7B),並支援透明背景與多參考圖編輯。

輕量化架構設計

Qwen-Image-2.1 採用 32 層單流 DiT(Single-Stream Diffusion Transformer)結構,並結合 Qwen3-VL 8B 作為文字與條件圖像編碼器,搭配 64 通道的 RGBA VAE(空間壓縮比 16x)。

該模型採用混合粒度注意力機制(Mixed-granularity Attention),實現高效的 Prefix KV Cache 重複使用。在執行影像編輯時,輸入圖像與指令經計算後會作為靜態背景快取,大幅降低後續去噪步驟的記憶體需求與計算延遲。開發者亦可啟用 enable_model_cpu_offload() 進行記憶體優化。

原生透明底圖與影像編輯

過去製作透明背景影像通常需要額外的後製去背。Qwen-Image-2.1 原生整合了 RGBA 透明度支援,使用者只需在提示詞中指定格式,模型即可直接輸出帶有 Alpha 通道的透明背景影像。

這項功能不僅限於全新生成,也支援透明圖層的即時編輯與主體提取。例如,你可以調整透明圖層中角色的表情而不影響背景透明度,或是從真實照片中提取特定主體轉換為透明圖層素材,顯著簡化設計工作流程。

多樣化的編輯工具與原生 2K 解析度

Qwen-Image-2.1 提供多種編輯手段以滿足精確控制需求:

  • 多參考影像: 最多可同時支援 10 張參考圖,適合多角色合照、虛擬試穿與室內設計合成。
  • 局部編輯: 支援圓形標註、手繪標註及獨立遮罩(Mask),確保區域修改時不影響其餘細節。
  • 高保真度: 針對人臉肖像特徵與產品材質細節進行優化,在多輪編輯中維持高度辨識度。
  • 原生 2K 解析度: 預設支援 2048 × 2048(1:1)原生 2K 解析度,並提供 16:9(2752 × 1536)、9:16、4:3 等多種長寬比。

體驗模型功能可前往官方展示頁面。

應用場景與提示詞改寫

除了基礎生成與修圖,Qwen-Image-2.1 在全景圖(Panorama)、資訊圖表(Infographics)與分鏡故事板(Storyboards)的製作上也具備應用彈性。

為了達到最佳生成效果,官方提供了專門的提示詞改寫模型(PE-T2I 與 PE-I2I,基於 Qwen3.5-VL 9B 微調),能將簡短描述自動擴充為詳細的英文指令與合適的長寬比。


常見問題解答 (FAQ)

Q:Qwen-Image-2.1 的預設推論參數為何? A:官方預設採樣步數(num_inference_steps)為 40 步,預設解析度為 2048 × 2048。可直接透過 Hugging Face 的 diffusers 函式庫(QwenImage21Pipeline)執行。

Q:如何生成透明背景圖片? A:建議使用官方推薦的提示詞格式:「This is an RGBA image with transparency. [你的描述]. The image has alpha channel and the background is transparent.」,引導模型輸出 RGBA 管道。

Q:模型是否支援中文輸入? A:建議配合官方推薦的提示詞改寫模型(PE-T2I 或 PE-I2I),將中文敘事自動轉換為高品質的詳細英文指令,以獲得最佳的構圖與細節表現。

Q:可以整合至現有工作流嗎? A:可以。除了 Python API,目前 ComfyUI 已經原生支援(Comfy-Org/Qwen-Image-2.1),亦可使用 vLLM-Omni、SGLang 或 LightX2V 等推理框架進行高效能服務部署。

Q:模型的授權條款為何? A:採用 Qwen Research License Agreement 授權。

相關連結

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.