Qwen-Image-2.1 最多可以一次放:
10 張 Reference Images。
看到這個功能,
最直覺的做法很可能是:
人物照丟進去。
商品照丟進去。
服裝照丟進去。
場景照丟進去。
風格照也丟進去。
最後說:
「幫我組成一張圖。」
但圖片愈多,
如果沒有說清楚每一張到底負責什麼,
AI 反而要自己猜。
今天只學一個方法:
一張圖,只給一個主要任務。
不要先寫 Prompt,先替圖片分工
假設你要做一張:
人物拿著指定包包,
穿指定外套,
站在指定咖啡廳裡的廣告照片。
你有四張 Reference。
不要只說:
「參考這四張圖幫我生成。」
先把它們分工。
例如:
圖 1:人物身份
只參考:
臉、
髮型、
大致人物特徵。
圖 2:衣服
只參考:
外套款式、
顏色、
材質。
圖 3:商品
只參考:
包包外觀、
比例、
主要結構。
圖 4:場景
只參考:
咖啡廳空間、
家具配置、
環境感。
然後才說最後任務:
把圖 1 的人物,穿上圖 2 的外套,拿著圖 3 的包包,放進圖 4 的咖啡廳。
這就比:
「請融合這四張圖片」
清楚很多。
官方示範本來就是這樣做
Qwen-Image-2.1 官方展示一個 Virtual Try-on 範例。
不是拿五張差不多的人物照。
而是五張圖各自提供不同東西:
Model。
Clothing。
Shoes。
Bag。
Hat。
最後才組成:
一套完整 Outfit。
官方也展示過:
用 10 張 Furniture References,
組成一個完整 Interior。
這其實已經透露多 Reference 最實用的使用方式:
每張圖提供一個明確資產。
不是:
每張都讓 AI 全部參考。
為什麼「全部參考」容易出問題?
假設圖 1 是人物照片。
裡面除了臉,
還有:
黑色 T-shirt。
白牆。
一張椅子。
暖色光線。
但你真正想要的只有:
這個人。
如果只告訴 AI:
「參考圖 1。」
模型就必須判斷:
到底要保留:
人物?
衣服?
背景?
燈光?
姿勢?
同時又有圖 2、圖 3、圖 4,
每張都帶著自己的:
背景、
光線、
構圖、
顏色。
資訊很容易互相競爭。
所以更好的方法不是一開始把 Prompt 寫得非常長。
而是先回答:
這張 Reference 到底為什麼存在?
最簡單的格式:圖號+角色+要拿什麼
可以直接用這個格式:
圖 1|人物
只參考人物身份與臉部特徵。
圖 2|服裝
只參考服裝款式、材質與顏色。
圖 3|商品
只參考商品外型與比例。
圖 4|場景
只參考空間與環境。
最後:
把以上四個元素組合成一張 16:9 寫實商業照片。
這就是今天整個技巧。
不是背更多 Prompt 關鍵字。
而是:
先替每一張圖分配工作。
在 ComfyUI 裡,甚至可以直接用 image_1、image_2
如果是自己跑 Qwen-Image-2.1,
ComfyUI 官方 Workflow Template 也採用很清楚的方式。
Reference Images 可以依序放成:
image_1
image_2
image_3
一直到:
image_10。
Prompt 裡則可以直接指定:
<image1>
<image2>
等 Reference。
例如:
「使用 <image1> 的人物,穿上 <image2> 的服裝。」
這種寫法的價值就是:
不要叫模型猜「上一張」「右邊那張」「那個商品照」到底指誰。
圖片一多,
直接指定來源會更清楚。
如果是在修改既有圖片,第一張的角色更重要
ComfyUI 的 Qwen-Image-2.1 Editing Template 還有一個很實際的規則:
image_1 是 Edit Target。
也就是:
這一張是主要要修改的底圖。
其他圖片則作為 References。
例如:
image_1:
原本人物照片。
image_2:
新的外套。
image_3:
新的包包。
那任務就很清楚:
不是重新融合三張照片。
而是:
以 image_1 為底,從 image_2、image_3 取得指定元素。
這會比三張圖片地位完全相同更容易理解。
不需要的 Reference,不要為了「最多 10 張」硬塞
另一個常見誤解是:
既然最多支援 10 張,
是不是放 10 張效果最好?
不是。
「最多 10 張」只是:
模型能接受的上限。
不是:
最佳張數。
假設你只需要:
人物、
商品、
場景。
三張就夠了。
再塞:
三張人物角度、
兩張風格照、
兩張其他場景
並不一定幫助結果。
反而增加模型要處理的:
視覺條件。
所以每加一張前,
只問:
這張圖提供了前面沒有的新資訊嗎?
如果沒有,
先不要加。
人物需要多角度時,可以例外
「一張圖一個任務」
不是說:
同一個人物永遠只能給一張照片。
例如你需要提高人物一致性,
可能有:
正面照。
側面照。
半身照。
這三張都屬於:
同一個任務:人物身份。
這時真正要告訴模型的是:
這三張 Reference 都在描述:
同一個人。
不要讓它把三張照片理解成:
三個不同人物。
所以更精確的原則是:
一組 Reference,只服務一種角色。
商品也一樣
例如一個包包,
正面看不到:
側邊結構。
背面看不到:
扣件細節。
這時可以提供:
正面。
側面。
背面。
但它們仍然只負責:
商品身份與結構。
不要同時又要求:
其中一張的背景、
另一張的拍攝光線、
第三張的桌面
也全部保留。
這和以前「保留/只改/禁止」不一樣
SasaDaily 8 月 6 日曾教過:
局部修圖前,
把 Prompt 分成:
保留/只改/禁止。
那一篇解決的是:
一張既有圖片要修改時,如何限制修改範圍。
今天處理的是另一個問題:
當輸入變成很多張 Reference 時,怎麼避免不同來源彼此搶角色。
所以今天不是先問:
「哪裡不能改?」
而是先問:
「這張圖到底負責什麼?」
兩個方法可以一起用。
最後只記這個順序
下一次準備丟多張 Reference 給 Qwen-Image-2.1,
不要:
10 張圖
→ 一句 Prompt
→ 祈禱模型自己理解。
改成:
先挑真正需要的圖片
↓
每張指定一個角色
↓
同一角色的多角度放成一組
↓
最後才描述整張完成圖
最簡單就是:
圖 1 是誰。
圖 2 穿什麼。
圖 3 拿什麼。
圖 4 在哪裡。
當 Reference Image 開始變多,
最重要的 Prompt 技巧反而不是:
寫更多。
而是:
不要讓一張圖片同時負責太多事情。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。