Qwen-Image-2.1 最多可以一次放:

10 張 Reference Images。

看到這個功能,

最直覺的做法很可能是:

人物照丟進去。

商品照丟進去。

服裝照丟進去。

場景照丟進去。

風格照也丟進去。

最後說:

「幫我組成一張圖。」

但圖片愈多,

如果沒有說清楚每一張到底負責什麼,

AI 反而要自己猜。

今天只學一個方法:

一張圖,只給一個主要任務。

不要先寫 Prompt,先替圖片分工

假設你要做一張:

人物拿著指定包包,

穿指定外套,

站在指定咖啡廳裡的廣告照片。

你有四張 Reference。

不要只說:

「參考這四張圖幫我生成。」

先把它們分工。

例如:

圖 1:人物身份

只參考:

臉、

髮型、

大致人物特徵。

圖 2:衣服

只參考:

外套款式、

顏色、

材質。

圖 3:商品

只參考:

包包外觀、

比例、

主要結構。

圖 4:場景

只參考:

咖啡廳空間、

家具配置、

環境感。

然後才說最後任務:

把圖 1 的人物,穿上圖 2 的外套,拿著圖 3 的包包,放進圖 4 的咖啡廳。

這就比:

「請融合這四張圖片」

清楚很多。

官方示範本來就是這樣做

Qwen-Image-2.1 官方展示一個 Virtual Try-on 範例。

不是拿五張差不多的人物照。

而是五張圖各自提供不同東西:

Model。

Clothing。

Shoes。

Bag。

Hat。

最後才組成:

一套完整 Outfit。

官方也展示過:

用 10 張 Furniture References,

組成一個完整 Interior。

這其實已經透露多 Reference 最實用的使用方式:

每張圖提供一個明確資產。

不是:

每張都讓 AI 全部參考。

為什麼「全部參考」容易出問題?

假設圖 1 是人物照片。

裡面除了臉,

還有:

黑色 T-shirt。

白牆。

一張椅子。

暖色光線。

但你真正想要的只有:

這個人。

如果只告訴 AI:

「參考圖 1。」

模型就必須判斷:

到底要保留:

人物?

衣服?

背景?

燈光?

姿勢?

同時又有圖 2、圖 3、圖 4,

每張都帶著自己的:

背景、

光線、

構圖、

顏色。

資訊很容易互相競爭。

所以更好的方法不是一開始把 Prompt 寫得非常長。

而是先回答:

這張 Reference 到底為什麼存在?

最簡單的格式:圖號+角色+要拿什麼

可以直接用這個格式:

圖 1|人物

只參考人物身份與臉部特徵。

圖 2|服裝

只參考服裝款式、材質與顏色。

圖 3|商品

只參考商品外型與比例。

圖 4|場景

只參考空間與環境。

最後:

把以上四個元素組合成一張 16:9 寫實商業照片。

這就是今天整個技巧。

不是背更多 Prompt 關鍵字。

而是:

先替每一張圖分配工作。

在 ComfyUI 裡,甚至可以直接用 image_1、image_2

如果是自己跑 Qwen-Image-2.1,

ComfyUI 官方 Workflow Template 也採用很清楚的方式。

Reference Images 可以依序放成:

image_1

image_2

image_3

一直到:

image_10。

Prompt 裡則可以直接指定:

<image1>

<image2>

等 Reference。

例如:

「使用 <image1> 的人物,穿上 <image2> 的服裝。」

這種寫法的價值就是:

不要叫模型猜「上一張」「右邊那張」「那個商品照」到底指誰。

圖片一多,

直接指定來源會更清楚。

如果是在修改既有圖片,第一張的角色更重要

ComfyUI 的 Qwen-Image-2.1 Editing Template 還有一個很實際的規則:

image_1 是 Edit Target。

也就是:

這一張是主要要修改的底圖。

其他圖片則作為 References。

例如:

image_1:

原本人物照片。

image_2:

新的外套。

image_3:

新的包包。

那任務就很清楚:

不是重新融合三張照片。

而是:

以 image_1 為底,從 image_2、image_3 取得指定元素。

這會比三張圖片地位完全相同更容易理解。

不需要的 Reference,不要為了「最多 10 張」硬塞

另一個常見誤解是:

既然最多支援 10 張,

是不是放 10 張效果最好?

不是。

「最多 10 張」只是:

模型能接受的上限。

不是:

最佳張數。

假設你只需要:

人物、

商品、

場景。

三張就夠了。

再塞:

三張人物角度、

兩張風格照、

兩張其他場景

並不一定幫助結果。

反而增加模型要處理的:

視覺條件。

所以每加一張前,

只問:

這張圖提供了前面沒有的新資訊嗎?

如果沒有,

先不要加。

人物需要多角度時,可以例外

「一張圖一個任務」

不是說:

同一個人物永遠只能給一張照片。

例如你需要提高人物一致性,

可能有:

正面照。

側面照。

半身照。

這三張都屬於:

同一個任務:人物身份。

這時真正要告訴模型的是:

這三張 Reference 都在描述:

同一個人。

不要讓它把三張照片理解成:

三個不同人物。

所以更精確的原則是:

一組 Reference,只服務一種角色。

商品也一樣

例如一個包包,

正面看不到:

側邊結構。

背面看不到:

扣件細節。

這時可以提供:

正面。

側面。

背面。

但它們仍然只負責:

商品身份與結構。

不要同時又要求:

其中一張的背景、

另一張的拍攝光線、

第三張的桌面

也全部保留。

這和以前「保留/只改/禁止」不一樣

SasaDaily 8 月 6 日曾教過:

局部修圖前,

把 Prompt 分成:

保留/只改/禁止。

那一篇解決的是:

一張既有圖片要修改時,如何限制修改範圍。

今天處理的是另一個問題:

當輸入變成很多張 Reference 時,怎麼避免不同來源彼此搶角色。

所以今天不是先問:

「哪裡不能改?」

而是先問:

「這張圖到底負責什麼?」

兩個方法可以一起用。

最後只記這個順序

下一次準備丟多張 Reference 給 Qwen-Image-2.1,

不要:

10 張圖

→ 一句 Prompt

→ 祈禱模型自己理解。

改成:

先挑真正需要的圖片

每張指定一個角色

同一角色的多角度放成一組

最後才描述整張完成圖

最簡單就是:

圖 1 是誰。

圖 2 穿什麼。

圖 3 拿什麼。

圖 4 在哪裡。

當 Reference Image 開始變多,

最重要的 Prompt 技巧反而不是:

寫更多。

而是:

不要讓一張圖片同時負責太多事情。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

AI 一分鐘教學|2026/08/06:局部修圖前,先把 Prompt 寫成「保留、只改、禁止」三段

今日 AI 工具