AI 生图最常遇到一个很实际的问题:
第一张很漂亮。
但你想改一点东西之后,
整张图又变了。
人物脸换掉。
商品形状跑掉。
衣服变了。
背景也跟着重画。
如果一次要参考:
人物、
衣服、
鞋子、
商品、
场景,
模型更容易混在一起。
Qwen 最新发布的 Qwen-Image-2.1,
想处理的正是这类问题。
Qwen-Image-2.1 是什么?
它是 Qwen 最新的:
Image Generation+Image Editing Model。
和过去常见的:
一个模型负责生图,
另一个工具再负责:
去背、
Inpainting、
局部修改
不同,
Qwen-Image-2.1 把很多任务作放进:
同一个模型。
目前官方列出的核心能力包括:
- Text-to-Image
- Existing Image Editing
- Multi-reference Editing
- Local Editing
- Transparent Image Generation
- Subject Extraction
- Text Rendering
- Portrait/Product Fidelity
所以它比较不像:
「一句 Prompt 帮我画一张漂亮图片。」
而开始比较接近:
完整的图片制作工具。
第一个最实用的功能:最多 10 张 Reference Images
这可能是一般创作者最值得注意的地方。
Qwen-Image-2.1 最多可以一次使用:
10 张 Reference Images。
例如你想做一张品牌形象照。
可以分别提供:
第 1 张:
人物。
第 2 张:
上衣。
第 3 张:
裤子。
第 4 张:
鞋子。
第 5 张:
包包。
第 6 张:
帽子。
第 7 张:
拍摄场景。
再要求 AI:
把这些元素组合成一张完整照片。
官方展示的案例里,
甚至直接把:
人物、
衣服、
鞋子、
包包、
帽子
从不同图片组合成一个完整 Outfit。
这和以前:
只给一张参考图,再用文字描述其他元素
很不一样。
为什么多 Reference 很重要?
因为文字描述不一定能精准保存:
商品比例。
人物特征。
服装细节。
品牌设计。
例如你跟 AI 说:
「黑色皮革手提包。」
它可能生成一个:
看起来合理的黑色皮包。
但你真正要的是:
这一个商品。
这时候图片 Reference 的价值就比文字高很多。
所以真正实用的 Workflow 会慢慢变成:
人物 Reference
+商品 Reference
+服装 Reference
+场景 Reference
+文字 Instruction。
而不是所有东西都靠 Prompt 猜。
第二个功能:不要整张重画,只改指定区域
Qwen-Image-2.1 也支持:
Local Editing。
你可以用:
Circle、
Painted Annotation、
Mask
指出:
哪个地方要改。
例如一张人物照片里:
圈住手表。
要求:
「移除手表。」
圈住头发。
要求:
「改成深棕色。」
选取衣服。
要求:
「换成米白色衬衫。」
真正的目的不是让 AI:
再生一张「差不多的人」。
而是:
把修改范围缩小。
这对:
商品图、
人物形象照、
广告素材、
社区图片
都比较实用。
但「只圈这里」不代表其他地方一定 Pixel-level 完全不变
这一点还是要保留现实。
Image Generation Model 本质上仍然是在重新推理图片。
Local Edit 的目标是:
更精准控制修改范围。
不是保证:
其他每一个 Pixel 都 Bit-for-bit 完全相同。
所以如果是:
Logo、
精确商品包装、
法律文档、
医疗图片、
需要完全固定的设计元素,
修改后仍然要:
重新比对。
不要只因为用了 Mask,
就认定其他地方一定没有变。
第三个功能:直接生成透明背景
这个功能其实非常实用。
Qwen-Image-2.1 原生支持:
RGBA Transparent Image。
也就是图片本身就可以有:
Alpha Channel。
简单讲:
背景可以直接是透明的。
例如你可以生成:
Sticker。
商品素材。
人物 Cutout。
演示文稿插图。
网站 Icon。
视频叠加元素。
以前常见流程可能是:
生成图片
↓
再丢到另一个工具去背
↓
修边
↓
输出 PNG。
现在模型可以直接:
从生成阶段处理 Transparency。
已经有照片,也能直接抽出主体
透明背景不只用在:
从零开始生成。
官方还特别列出:
Subject Extraction。
例如你有一张:
咖啡杯放在桌上的照片。
可以要求模型:
留下咖啡杯,
把其他背景移除,
输出透明素材。
对:
电商、
广告、
演示文稿、
社区设计
都很实际。
因为很多任务作真正花时间的不是:
「创作一张艺术图。」
而是:
把素材整理成能继续使用的格式。
第四个功能:原生支持 2K
官方目前列出的 Native Resolution 是:
2K。
例如 1:1:
2048 × 2048。
也提供:
4:3、
3:4、
3:2、
2:3、
16:9、
9:16
等建议尺寸。
这对内容创作者很实用。
因为同一个 Model 就能直接处理:
Instagram Square。
Website 16:9。
Reels/Shorts 9:16。
直式海报。
横式广告。
不用每次先生成正方形,
再另外裁切。
但 7B 不代表整套模型只有 7B
官方很强调:
7B Parameters。
不过这里要看完整说法。
7B 指的是:
Visual Generation Component。
也就是内核图像生成 Transformer。
Qwen-Image-2.1 另外使用:
Qwen3-VL 8B
作为 Text Encoder,
负责理解:
文字 Instruction
和:
Reference Images。
所以不要把:
「7B Visual Generation Component」
简化成:
整套系统总共只有 7B。
比较准确的说法是:
Qwen 希望把主要图像生成部分做得更 Compact,
同时保留多 Reference 与 Editing 能力。
为什么它要做得比较小?
Image Model 很容易遇到一个现实问题:
越强,GPU 越吃。
如果每一次:
生成、
改图、
多 Reference
都需要非常大的 Compute,
实际部署成本会很高。
Qwen-Image-2.1 使用:
Mixed-granularity Attention
和:
Prefix KV Cache Reuse。
尤其多图 Editing 时,
Reference Images 与文字 Context 不需要每一个 Denoising Step 全部重新计算。
简单理解就是:
已经看过的 Reference,不要一直重新读。
目的是减少重复运算。
Prompt 太短,官方甚至另外准备 AI 帮你重写
另一个很有意思的功能是:
Qwen 这次还另外发布两个:
Prompt Rewriting Models。
一个专门处理:
Text-to-Image。
另一个处理:
Image Editing。
例如你只写:
「把天空改成夕阳。」
Prompt Rewriter 可以先帮你展开成更完整的描述:
哪些地方要改。
夕阳的光线如何。
哪些主体应保持。
输出比例如何处理。
也就是:
先让一个 AI 把你的需求整理好,再交给图片 AI。
这个方向很值得注意。
因为一般用户不一定需要自己背:
几十种 Prompt 技巧。
模型前面可以再加一层:
Instruction Translator。
那现在要去哪里用?
目前最直接的方式主要有几种。
如果只是想体验:
官方 Repository 提供 Hugging Face Demo 入口。
ModelScope 也支持:
Online Generation。
如果自己有 GPU,
可以使用:
Diffusers。
Qwen-Image-2.1 在发布当天就取得 Day-0 Support。
如果平常习惯可视化 Workflow,
也可以使用:
ComfyUI。
ComfyUI 同样在发布当天就原生支持:
Text-to-Image
和:
Image Editing。
所以它不是只有:
「Weights 放出来,大家自己想办法。」
相关生态工具已经同步接上。
一般用户需要自己装吗?
不一定。
如果只是:
测试效果、
偶尔生图,
先使用 Online Demo 比较简单。
Local Deployment 比较适合:
想控制 Workflow、
大量生成、
研究 Model、
需要自己管理素材、
或本来就会用 ComfyUI/Diffusers
的人。
因为自己跑还涉及:
GPU VRAM、
Python Environment、
Model Weights、
Storage、
Inference Settings。
所以「公开权重」不等于:
下载一个 App 就能直接跑。
最大的提醒:公开权重,不等于自由商用
这是今天最不能忽略的一点。
Qwen 官方把 Qwen-Image-2.1 称为:
Open-source Image Generation Model。
模型 Weights 也确实公开下载。
但它目前不是一般常见的:
Apache 2.0
License。
而是:
Qwen Research License Agreement。
这份 License 明确写出:
目前授权是:
Non-commercial Research/Evaluation。
如果要把 Qwen-Image-2.1 Materials 用于:
Commercial Purpose,
需要另外取得:
Commercial License。
所以:
可以下载模型,
不等于:
可以直接拿来替客户做商业产品。
这两件事一定要分开。
那生成出来的图片也完全不能商用吗?
这里不要过度简化。
官方 License 的主要限制,
明确针对的是:
Qwen Materials
以及利用这套 Materials 的 Commercial Use。
但实际商用一张生成图片时,
还可能同时涉及:
你是透过哪个 Service 使用、
该服务自己的 Terms、
Reference Image 权利、
人物肖像、
Trademark、
Copyright
等问题。
所以最安全的做法不是看到:
「Open-source」
就直接下结论:
所有 Output 随便商用。
如果你准备把它放进:
收费服务、
客户项目、
商业产品、
大量 API Workflow,
先确认:
你使用的模型/平台到底适用哪份 License。
Qwen-Image-2.1 真正值得看的不是 Benchmark
今天这个工具最实用的地方,
其实可以浓缩成四件事:
多张 Reference
让 AI 不必只靠文字猜人物、商品与风格。
Local Editing
让修改范围变得更明确。
Native Transparency
少掉额外去背流程。
Unified Model
不用每做一个步骤就换一个不同 Model。
这意味着 AI 图像工具正在从:
「帮我生成一张漂亮的图。」
往:
「帮我完成一段图片制作流程。」
移动。
对真正做内容的人来说,
后者才更有价值。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
AI 晚报|2026/08/01:欧盟明天开始要求 AI 内容揭露身分,生成图片、深伪视频与聊天机器人进入「必须说清楚」时代