这篇教程用一组“二次元原图 → 真人效果图”训练编辑 LoRA,让 Qwen Image 2.1 学会一种明确的转换方式。流程是:准备成对图片、配置训练任务、先检查采样能否运行,再根据中途样片选择合适的 LoRA。
对应 9 月 22 日的视频教程。下面按视频中的云端 AI Toolkit 环境讲解,镜像里已经准备好模型;本地安装请使用文末的项目说明。
先准备什么
- 支持 Qwen Image 2.1 的 AI Toolkit 环境,以及对应的模型。
- 一组原始图片,以及与它们一一对应的目标图片。
- 准备一个用于表达转换目标的触发词或短语。视频中的例子是
photo realistic、Live action。
先决定自己要学习哪一种转换,再收集数据。例如目标是真人风格,目标图就应体现你想保留的真人质感;不要把明显不同的目标效果混在一起,却期待模型自动理解你偏好哪一种。
1. 把原图和目标图配对
AI Toolkit 中的两类图片承担不同的作用:
| 文件夹 | 放什么 | 本教程的例子 |
|---|---|---|
control | 编辑前的输入图片 | 二次元原图 |
targets | 希望模型生成的目标图片 | 对应的真人效果图 |
同一组图片的命名要对应。 模型需要学习的是这张原图应该怎样变化,而不是任意两张图之间的关系。
目录可以按下面的示意整理,示例文件名可自行更换:
dataset/
├── control/
│ ├── character_a.png
│ └── character_b.png
└── targets/
├── character_a.png
└── character_b.png
把两个文件夹上传到数据集目录,刷新 AI Toolkit 的数据集页面,再打开图片抽查:原图与目标图是否配对、文件有没有放反、目标效果是不是你真正想学的。
2. 建立编辑训练任务
使用教程提供的已有任务时,先复制一份再修改。这样可以保留原配置,也更容易比较不同精度或参数的结果。
在任务中完成这些设置:
- 选择 Qwen Image 2.1,确认这是本次要训练的模型。
- 在数据集配置中,将目标图绑定到
target,原图绑定到control。 - 填入自己的触发词,并让测试采样也使用同样的转换描述。
- 替换示例采样图片,使用自己的原图测试;否则看到的是别人的例图表现。
视频中的这套编辑配置没有为每张图片单独写 caption,而是使用统一的默认文字条件和触发词。因此,“没有逐张打标”不等于完全不需要提示词。你仍要告诉模型这组编辑任务希望完成什么转换。
3. 在精度、显存和速度之间选择
视频比较了两种运行方式:
| 方式 | 视频里的观察 | 选择时看什么 |
|---|---|---|
| bf16 | 使用 4090 演示,作者更满意训练效果 | 显存是否够用,以及样片质量 |
| INT8/8bit 量化路径 | 提到了 3090 的使用方式,速度更快、显存压力更小,但该次测试效果较差 | 节省的资源是否值得这次效果损失 |
这是视频里那套模型、数据和配置的比较,不是单凭显卡型号就能判断能否运行。尤其要区分训练占用和采样占用:训练已经开始,后续生成样片时仍可能爆显存。
视频使用过 1280 分辨率,并在显存不足时调整 offloading。初次跑自己的数据时,先用能稳定完成采样的分辨率,再逐步提高。
4. 先跑采样,再跑长训练
启动任务后先观察起始采样。它能同时帮助你检查:数据绑定是否正确、提示词是否匹配、模型是否能在当前配置下生成图片。
如果采样时报显存不足,按这个顺序排查:
- 降低训练/采样分辨率。 不要在显存已经不足时继续坚持高分辨率。
- 检查 offloading。 视频里一次失败就发生在没有开启卸载的配置中。
- 重新跑采样。 确认问题消失后,再继续完整训练。
- 若仍无法运行,再考虑量化路径,同时重新比较效果。
视频演示中曾把一个卸载相关设置调整到 30,但字幕没有保留准确字段名,不能据此把界面里任意百分比都设成 30。对应操作可直接看 约 5 分 30 秒。
5. 训练多少步,用哪个版本
视频中跑到了 5000 步,但作者在 500 步已经看见变化,在 1000 步和 1750 步附近已经得到不错的效果。因此这套数据不必为了跑满计划而一直训练。
实际使用时保留中途版本,用相同的测试原图和提示词对比:
- 目标风格是否已经出现?
- 需要保留的人物特征和构图有没有被改坏?
- 继续训练后,是否真的比前一个版本更好?
视频中的一次迭代约 5.44 秒,“大约两小时”描述的是该次训练的量级。自己的耗时还会随步数、分辨率、量化与卸载设置变化。
训练完成后怎么用
下载训练得到的 LoRA,在对应的 Qwen Image 2.1 编辑工作流里测试。也可以使用 AI Toolkit 自带的测试入口,选择模型和 LoRA 后直接生成,先确认效果,再搬到常用的 ComfyUI 工作流。
基础模型的文生图、编辑和透明底图用法见 Qwen Image 2.1 使用笔记:文生图、图像编辑与透明底图。