AI 生圖最常遇到一個很實際的問題:

第一張很漂亮。

但你想改一點東西之後,

整張圖又變了。

人物臉換掉。

商品形狀跑掉。

衣服變了。

背景也跟著重畫。

如果一次要參考:

人物、

衣服、

鞋子、

商品、

場景,

模型更容易混在一起。

Qwen 最新發布的 Qwen-Image-2.1

想處理的正是這類問題。

Qwen-Image-2.1 是什麼?

它是 Qwen 最新的:

Image Generation+Image Editing Model。

和過去常見的:

一個模型負責生圖,

另一個工具再負責:

去背、

Inpainting、

局部修改

不同,

Qwen-Image-2.1 把很多工作放進:

同一個模型。

目前官方列出的核心能力包括:

  • Text-to-Image
  • Existing Image Editing
  • Multi-reference Editing
  • Local Editing
  • Transparent Image Generation
  • Subject Extraction
  • Text Rendering
  • Portrait/Product Fidelity

所以它比較不像:

「一句 Prompt 幫我畫一張漂亮圖片。」

而開始比較接近:

完整的圖片製作工具。

第一個最實用的功能:最多 10 張 Reference Images

這可能是一般創作者最值得注意的地方。

Qwen-Image-2.1 最多可以一次使用:

10 張 Reference Images。

例如你想做一張品牌形象照。

可以分別提供:

第 1 張:

人物。

第 2 張:

上衣。

第 3 張:

褲子。

第 4 張:

鞋子。

第 5 張:

包包。

第 6 張:

帽子。

第 7 張:

拍攝場景。

再要求 AI:

把這些元素組合成一張完整照片。

官方展示的案例裡,

甚至直接把:

人物、

衣服、

鞋子、

包包、

帽子

從不同圖片組合成一個完整 Outfit。

這和以前:

只給一張參考圖,再用文字描述其他元素

很不一樣。

為什麼多 Reference 很重要?

因為文字描述不一定能精準保存:

商品比例。

人物特徵。

服裝細節。

品牌設計。

例如你跟 AI 說:

「黑色皮革手提包。」

它可能生成一個:

看起來合理的黑色皮包。

但你真正要的是:

這一個商品。

這時候圖片 Reference 的價值就比文字高很多。

所以真正實用的 Workflow 會慢慢變成:

人物 Reference

+商品 Reference

+服裝 Reference

+場景 Reference

+文字 Instruction。

而不是所有東西都靠 Prompt 猜。

第二個功能:不要整張重畫,只改指定區域

Qwen-Image-2.1 也支援:

Local Editing。

你可以用:

Circle、

Painted Annotation、

Mask

指出:

哪個地方要改。

例如一張人物照片裡:

圈住手錶。

要求:

「移除手錶。」

圈住頭髮。

要求:

「改成深棕色。」

選取衣服。

要求:

「換成米白色襯衫。」

真正的目的不是讓 AI:

再生一張「差不多的人」。

而是:

把修改範圍縮小。

這對:

商品圖、

人物形象照、

廣告素材、

社群圖片

都比較實用。

但「只圈這裡」不代表其他地方一定 Pixel-level 完全不變

這一點還是要保留現實。

Image Generation Model 本質上仍然是在重新推理圖片。

Local Edit 的目標是:

更精準控制修改範圍。

不是保證:

其他每一個 Pixel 都 Bit-for-bit 完全相同。

所以如果是:

Logo、

精確商品包裝、

法律文件、

醫療圖片、

需要完全固定的設計元素,

修改後仍然要:

重新比對。

不要只因為用了 Mask,

就認定其他地方一定沒有變。

第三個功能:直接生成透明背景

這個功能其實非常實用。

Qwen-Image-2.1 原生支援:

RGBA Transparent Image。

也就是圖片本身就可以有:

Alpha Channel。

簡單講:

背景可以直接是透明的。

例如你可以生成:

Sticker。

商品素材。

人物 Cutout。

簡報插圖。

網站 Icon。

影片疊加元素。

以前常見流程可能是:

生成圖片

再丟到另一個工具去背

修邊

輸出 PNG。

現在模型可以直接:

從生成階段處理 Transparency。

已經有照片,也能直接抽出主體

透明背景不只用在:

從零開始生成。

官方還特別列出:

Subject Extraction。

例如你有一張:

咖啡杯放在桌上的照片。

可以要求模型:

留下咖啡杯,

把其他背景移除,

輸出透明素材。

對:

電商、

廣告、

簡報、

社群設計

都很實際。

因為很多工作真正花時間的不是:

「創作一張藝術圖。」

而是:

把素材整理成能繼續使用的格式。

第四個功能:原生支援 2K

官方目前列出的 Native Resolution 是:

2K。

例如 1:1:

2048 × 2048。

也提供:

4:3、

3:4、

3:2、

2:3、

16:9、

9:16

等建議尺寸。

這對內容創作者很實用。

因為同一個 Model 就能直接處理:

Instagram Square。

Website 16:9。

Reels/Shorts 9:16。

直式海報。

橫式廣告。

不用每次先生成正方形,

再另外裁切。

但 7B 不代表整套模型只有 7B

官方很強調:

7B Parameters。

不過這裡要看完整說法。

7B 指的是:

Visual Generation Component。

也就是核心圖像生成 Transformer。

Qwen-Image-2.1 另外使用:

Qwen3-VL 8B

作為 Text Encoder,

負責理解:

文字 Instruction

和:

Reference Images。

所以不要把:

「7B Visual Generation Component」

簡化成:

整套系統總共只有 7B。

比較準確的說法是:

Qwen 希望把主要圖像生成部分做得更 Compact,

同時保留多 Reference 與 Editing 能力。

為什麼它要做得比較小?

Image Model 很容易遇到一個現實問題:

越強,GPU 越吃。

如果每一次:

生成、

改圖、

多 Reference

都需要非常大的 Compute,

實際部署成本會很高。

Qwen-Image-2.1 使用:

Mixed-granularity Attention

和:

Prefix KV Cache Reuse。

尤其多圖 Editing 時,

Reference Images 與文字 Context 不需要每一個 Denoising Step 全部重新計算。

簡單理解就是:

已經看過的 Reference,不要一直重新讀。

目的是減少重複運算。

Prompt 太短,官方甚至另外準備 AI 幫你重寫

另一個很有意思的功能是:

Qwen 這次還另外釋出兩個:

Prompt Rewriting Models。

一個專門處理:

Text-to-Image。

另一個處理:

Image Editing。

例如你只寫:

「把天空改成夕陽。」

Prompt Rewriter 可以先幫你展開成更完整的描述:

哪些地方要改。

夕陽的光線如何。

哪些主體應保持。

輸出比例如何處理。

也就是:

先讓一個 AI 把你的需求整理好,再交給圖片 AI。

這個方向很值得注意。

因為一般使用者不一定需要自己背:

幾十種 Prompt 技巧。

模型前面可以再加一層:

Instruction Translator。

那現在要去哪裡用?

目前最直接的方式主要有幾種。

如果只是想體驗:

官方 Repository 提供 Hugging Face Demo 入口。

ModelScope 也支援:

Online Generation。

如果自己有 GPU,

可以使用:

Diffusers。

Qwen-Image-2.1 在發布當天就取得 Day-0 Support。

如果平常習慣視覺化 Workflow,

也可以使用:

ComfyUI。

ComfyUI 同樣在發布當天就原生支援:

Text-to-Image

和:

Image Editing。

所以它不是只有:

「Weights 放出來,大家自己想辦法。」

相關生態工具已經同步接上。

一般使用者需要自己裝嗎?

不一定。

如果只是:

測試效果、

偶爾生圖,

先使用 Online Demo 比較簡單。

Local Deployment 比較適合:

想控制 Workflow、

大量生成、

研究 Model、

需要自己管理素材、

或本來就會用 ComfyUI/Diffusers

的人。

因為自己跑還涉及:

GPU VRAM、

Python Environment、

Model Weights、

Storage、

Inference Settings。

所以「公開權重」不等於:

下載一個 App 就能直接跑。

最大的提醒:公開權重,不等於自由商用

這是今天最不能忽略的一點。

Qwen 官方把 Qwen-Image-2.1 稱為:

Open-source Image Generation Model。

模型 Weights 也確實公開下載。

但它目前不是一般常見的:

Apache 2.0

License。

而是:

Qwen Research License Agreement。

這份 License 明確寫出:

目前授權是:

Non-commercial Research/Evaluation。

如果要把 Qwen-Image-2.1 Materials 用於:

Commercial Purpose,

需要另外取得:

Commercial License。

所以:

可以下載模型,

不等於:

可以直接拿來替客戶做商業產品。

這兩件事一定要分開。

那生成出來的圖片也完全不能商用嗎?

這裡不要過度簡化。

官方 License 的主要限制,

明確針對的是:

Qwen Materials

以及利用這套 Materials 的 Commercial Use。

但實際商用一張生成圖片時,

還可能同時涉及:

你是透過哪個 Service 使用、

該服務自己的 Terms、

Reference Image 權利、

人物肖像、

Trademark、

Copyright

等問題。

所以最安全的做法不是看到:

「Open-source」

就直接下結論:

所有 Output 隨便商用。

如果你準備把它放進:

收費服務、

客戶專案、

商業產品、

大量 API Workflow,

先確認:

你使用的模型/平台到底適用哪份 License。

Qwen-Image-2.1 真正值得看的不是 Benchmark

今天這個工具最實用的地方,

其實可以濃縮成四件事:

多張 Reference

讓 AI 不必只靠文字猜人物、商品與風格。

Local Editing

讓修改範圍變得更明確。

Native Transparency

少掉額外去背流程。

Unified Model

不用每做一個步驟就換一個不同 Model。

這意味著 AI 圖像工具正在從:

「幫我生成一張漂亮的圖。」

往:

「幫我完成一段圖片製作流程。」

移動。

對真正做內容的人來說,

後者才更有價值。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

今日 AI 工具

AI 晚報|2026/08/01:歐盟明天開始要求 AI 內容揭露身分,生成圖片、深偽影片與聊天機器人進入「必須說清楚」時代