Qwen-Image-2.1 最多可以一次放:

10 张 Reference Images。

看到这个功能,

最直觉的做法很可能是:

人物照丢进去。

商品照丢进去。

服装照丢进去。

场景照丢进去。

风格照也丢进去。

最后说:

「帮我组成一张图。」

但图片愈多,

如果没有说清楚每一张到底负责什么,

AI 反而要自己猜。

今天只学一个方法:

一张图,只给一个主要任务。

不要先写 Prompt,先替图片分工

假设你要做一张:

人物拿着指定包包,

穿指定外套,

站在指定咖啡厅里的广告照片。

你有四张 Reference。

不要只说:

「参考这四张图帮我生成。」

先把它们分工。

例如:

图 1:人物身份

只参考:

脸、

发型、

大致人物特征。

图 2:衣服

只参考:

外套款式、

颜色、

材质。

图 3:商品

只参考:

包包外观、

比例、

主要结构。

图 4:场景

只参考:

咖啡厅空间、

家具配置、

环境感。

然后才说最后任务:

把图 1 的人物,穿上图 2 的外套,拿着图 3 的包包,放进图 4 的咖啡厅。

这就比:

「请融合这四张图片」

清楚很多。

官方示范本来就是这样做

Qwen-Image-2.1 官方展示一个 Virtual Try-on 范例。

不是拿五张差不多的人物照。

而是五张图各自提供不同东西:

Model。

Clothing。

Shoes。

Bag。

Hat。

最后才组成:

一套完整 Outfit。

官方也展示过:

用 10 张 Furniture References,

组成一个完整 Interior。

这其实已经透露多 Reference 最实用的使用方式:

每张图提供一个明确资产。

不是:

每张都让 AI 全部参考。

为什么「全部参考」容易出问题?

假设图 1 是人物照片。

里面除了脸,

还有:

黑色 T-shirt。

白墙。

一张椅子。

暖色光线。

但你真正想要的只有:

这个人。

如果只告诉 AI:

「参考图 1。」

模型就必须判断:

到底要保留:

人物?

衣服?

背景?

灯光?

姿势?

同时又有图 2、图 3、图 4,

每张都带着自己的:

背景、

光线、

构图、

颜色。

信息很容易互相竞争。

所以更好的方法不是一开始把 Prompt 写得非常长。

而是先回答:

这张 Reference 到底为什么存在?

最简单的格式:图号+角色+要拿什么

可以直接用这个格式:

图 1|人物

只参考人物身份与脸部特征。

图 2|服装

只参考服装款式、材质与颜色。

图 3|商品

只参考商品外型与比例。

图 4|场景

只参考空间与环境。

最后:

把以上四个元素组合成一张 16:9 写实商业照片。

这就是今天整个技巧。

不是背更多 Prompt 关键字。

而是:

先替每一张图分配工作。

在 ComfyUI 里,甚至可以直接用 image_1、image_2

如果是自己跑 Qwen-Image-2.1,

ComfyUI 官方 Workflow Template 也采用很清楚的方式。

Reference Images 可以依序放成:

image_1

image_2

image_3

一直到:

image_10。

Prompt 里则可以直接指定:

<image1>

<image2>

等 Reference。

例如:

「使用 <image1> 的人物,穿上 <image2> 的服装。」

这种写法的价值就是:

不要叫模型猜「上一张」「右边那张」「那个商品照」到底指谁。

图片一多,

直接指定来源会更清楚。

如果是在修改既有图片,第一张的角色更重要

ComfyUI 的 Qwen-Image-2.1 Editing Template 还有一个很实际的规则:

image_1 是 Edit Target。

也就是:

这一张是主要要修改的底图。

其他图片则作为 References。

例如:

image_1:

原本人物照片。

image_2:

新的外套。

image_3:

新的包包。

那任务就很清楚:

不是重新融合三张照片。

而是:

以 image_1 为底,从 image_2、image_3 取得指定元素。

这会比三张图片地位完全相同更容易理解。

不需要的 Reference,不要为了「最多 10 张」硬塞

另一个常见误解是:

既然最多支持 10 张,

是不是放 10 张效果最好?

不是。

「最多 10 张」只是:

模型能接受的上限。

不是:

最佳张数。

假设你只需要:

人物、

商品、

场景。

三张就够了。

再塞:

三张人物角度、

两张风格照、

两张其他场景

并不一定帮助结果。

反而增加模型要处理的:

视觉条件。

所以每加一张前,

只问:

这张图提供了前面没有的新信息吗?

如果没有,

先不要加。

人物需要多角度时,可以例外

「一张图一个任务」

不是说:

同一个人物永远只能给一张照片。

例如你需要提高人物一致性,

可能有:

正面照。

侧面照。

半身照。

这三张都属于:

同一个任务:人物身份。

这时真正要告诉模型的是:

这三张 Reference 都在描述:

同一个人。

不要让它把三张照片理解成:

三个不同人物。

所以更精确的原则是:

一组 Reference,只服务一种角色。

商品也一样

例如一个包包,

正面看不到:

侧边结构。

背面看不到:

扣件细节。

这时可以提供:

正面。

侧面。

背面。

但它们仍然只负责:

商品身份与结构。

不要同时又要求:

其中一张的背景、

另一张的拍摄光线、

第三张的桌面

也全部保留。

这和以前「保留/只改/禁止」不一样

SasaDaily 8 月 6 日曾教过:

局部修图前,

把 Prompt 分成:

保留/只改/禁止。

那一篇解决的是:

一张既有图片要修改时,如何限制修改范围。

今天处理的是另一个问题:

当输入变成很多张 Reference 时,怎么避免不同来源彼此抢角色。

所以今天不是先问:

「哪里不能改?」

而是先问:

「这张图到底负责什么?」

两个方法可以一起用。

最后只记这个顺序

下一次准备丢多张 Reference 给 Qwen-Image-2.1,

不要:

10 张图

→ 一句 Prompt

→ 祈祷模型自己理解。

改成:

先挑真正需要的图片

每张指定一个角色

同一角色的多角度放成一组

最后才描述整张完成图

最简单就是:

图 1 是谁。

图 2 穿什么。

图 3 拿什么。

图 4 在哪里。

当 Reference Image 开始变多,

最重要的 Prompt 技巧反而不是:

写更多。

而是:

不要让一张图片同时负责太多事情。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

AI 一分钟教学|2026/08/06:局部修图前,先把 Prompt 写成「保留、只改、禁止」三段

今日 AI 工具