Qwen Image 2.1 可以用文字生成图片,也能基于已有图片进行编辑。这篇教程按照视频里的两套 ComfyUI 工作流,说明提示词增强、采样步数、输出尺寸和分辨率预算怎么用,并整理实际测试中值得注意的问题。

对应 9 月 21 日的视频教程。先从文生图跑通基础配置,再尝试编辑和透明底图,会更容易区分问题出在哪里。

两套工作流怎么选

你想做什么使用哪套工作流主要输入
从零设计场景、海报、插画文生图创意描述
修改已有图片、生成角色三视图、上色图像编辑原图+编辑要求
生成透明底素材,或处理已有图的背景按是否已有原图选择透明背景要求,以及可选的原图

视频使用 Qwen Image 2.1 生成模型、Qwen3-VL 文本编码器和对应 VAE。模型各部分要和工作流匹配,不能只换一个生成模型文件,就默认其余配置也都适配。

1. 文生图:先描述创意,再决定是否增强提示词

视频里的文生图工作流接入了官方提示词增强模型。它的作用是把较短的创意补充成更具体的画面描述,再把结果送入生成模型。

使用顺序:

  1. 选择画面尺寸与分辨率。
  2. 输入想表达的主体、场景或画面创意。
  3. 需要补足描述时,经过提示词增强环节。
  4. 将生成的描述交给图像模型,检查结果,再调整原始创意。

如果你已经写好了足够清楚的提示词,重点是看增强后是否仍符合原意,而不是只看文字有没有变长。官方分别提供文生图和编辑方向的增强模型,使用说明见 Prompt Rewriting。

2. 步数和精度怎样设置

下面是视频中展示的选择,不同工作流仍应以自己的效果对比为准:

设置视频中的用法影响
25 步偏快速生成更快看到结果
40–50 步作者更偏向的高画质选择花更多采样时间,观察细节和噪点是否改善
bf16显存允许时优先使用视频中作者更满意这一精度的效果
较低精度的量化模型用于降低资源要求需要重新比较画质,不能只比较是否能运行

视频还指出,在它使用的 CFG=1 配置下,负面提示词不会起到预期作用。因此遇到画面问题时,不要只往负面提示词里堆词;先看正面描述、采样设置和模型能力是否足够。

3. 图像编辑:分清“画布尺寸”和“分辨率预算”

这两件事在使用时容易混在一起。

输出尺寸决定画面是什么形状。 例如原图是竖图,而你希望生成横向角色三视图,就需要使用指定的输出宽高,而不是沿用原图比例。视频演示了从原图比例切换到横向画布的做法。

分辨率预算影响参与处理的图像规模。 视频展示了这些取值:

预算值视频中的说明
1024较低的处理分辨率
1536作者常用的折中选择
2048更高分辨率,也会增加资源需求
0沿用图片原本的分辨率,需要留意输入图大小

如果原图很大,使用 0 可能把显存压力直接带进工作流。因此先确认输入图的尺寸,再决定是否沿用原尺寸。视频里的默认选择是 1536。

编辑任务中,先用清楚的普通指令说明“保留什么、改变什么”。视频的编辑工作流没有默认加提示词增强,作者认为多数演示任务已够用;需要更细的描述时,再把增强环节接入。

4. 透明底图怎么理解

这里的目标是输出带透明通道的图,而不是生成一张看起来像透明棋盘格的图片。文生图时写清楚透明背景要求;编辑时明确要去掉或修改哪个背景,并检查最终文件的透明通道。

视频演示了透明素材生成和抠图,官方项目也给出了 RGBA 生成的说明。具体例子见 模型项目。

实测中哪些地方表现好,哪些还要检查

  • 场景和光影:作者比较满意场景构图、光影,以及偏三维质感的画面。
  • 海报:整体排版可以很好看,但文字一多,仍可能出现局部乱码。出图后要逐处读文字。
  • 人物:手指和肢体仍可能出错,不能因为整体审美不错就跳过检查。
  • 编辑:角色三视图、漫画上色和风格转换都能尝试,但部分输入图仍可能处理不好。
  • 提示词语言:作者在本次测试中感觉英文更好用,可以将同一编辑要求写成中英文分别比较。

如果你需要持续稳定地完成一种编辑效果,例如二次元转真人,可以接着看 Qwen Image 2.1 编辑 LoRA:二次元转真人。

资源