---
id: h3-lora-training-modes
title: 用 AI Toolkit 训练 H3 参考生视频与编辑 LoRA
topic: LoRA训练
aliases:
- H3多参训练
- 参考生视频训练
- Ref2V
applicability: []
publish: true
---

这篇教程讲 H3 的参考生视频训练：怎样先确定训练目标，再准备参考素材、目标图片或视频，并在 AI Toolkit 里建立任务。视频同时演示了复杂概念数据和“二次元转真人”的编辑数据，它们的准备方式并不相同。

对应 [9 月 18 日的视频教程](https://www.bilibili.com/video/BV1foe26JE1h)，操作基于视频配套的云端 AI Toolkit 环境。

## 1. 先决定要让 LoRA 学什么

| 目标 | 主要素材 | 需要注意的关系 |
| --- | --- | --- |
| 角色 | 角色图片 | 外观特征是否一致 |
| 画风 | 同一风格的多种图片 | 不能只有单一人物、姿势和场景 |
| 编辑转换 | 原始素材＋目标素材 | 输入与目标必须配对 |
| 复杂视频概念 | 参考素材＋目标视频＋描述 | 参考对应关系、帧数、动作描述要正确 |

H3 有不同的条件输入方式。文生视频、首尾帧一类任务与任意参考素材一类任务，要选择相应模型和训练模式。视频中的参考生视频任务使用 Ref2V 方向；不要沿用前一期文生／图生视频任务后，只更换数据集路径。

如果你的目标只是用图片学习番剧画风，可以直接参考 [用 Musubi Tuner 训练 H3 番剧风格 LoRA](musubi-h3-anime-lora.md)。

## 2. 视频数据：先把帧数和参考素材整理好

视频里的复杂概念数据按帧数分组，每条目标视频都有对应的参考图。这样上传之后，可以明确知道当前 bucket 对应哪种视频长度，不必在训练时再猜素材属于哪一组。

H3 视频使用 **17k＋5** 的帧数规则。视频举过 22、73、141、158 帧等例子；作者分支的 H3 文档也确认了这一网格。素材帧数不匹配时，可能导致训练报错。

AI Toolkit 在本期演示中提供了 `auto frame counts`，可以向下对齐到支持的帧数。它能处理帧数对齐，但不会替你检查参考图有没有配错，也不会判断视频描述是否准确。

打标时重点检查这三件事：

- 描述的是不是当前这一条视频？批量交给 AI 时可能串片。
- 动作、人物与画面是否真的存在？不要把 AI 编出的细节留在描述里。
- 参考图与目标视频的对应关系是否一致？

视频作者建议借助官方提示词规范组织复杂概念的描述，但仍要抽查。训练简单图片概念时，不必照搬复杂视频的整套打标流程。

## 3. 编辑数据：control 是输入，targets 是目标

视频中的另一个例子是把二次元素材转换成真人效果。准备方式是两套对应的数据：

- `control`：原始输入，例如二次元图片。
- `targets`：希望生成的目标，例如对应的真人效果图。

作者把不同目标风格分成了不同组，一组更自然，另一组偏美颜效果。训练结果后来也会越来越倾向于数据里的风格，所以先看清楚目标数据是什么，再判断模型为什么学成那样。

这套图片编辑示例没有逐张单独打标，而是在任务中设置统一的 `default caption`，描述要做的转换。已有逐张描述的数据则使用自己的描述，不要把“没写旁边的文本文件”理解为“没有文字条件”。

## 4. 建立训练任务

上传完数据，在 AI Toolkit 中建立新任务，或复制教程已有任务后修改。按以下顺序检查：

1. **模型和模式**：选择当前要训练的 H3 参考生视频模型。
2. **训练方法与适配器**：确认是使用训练适配器，还是另一种训练方法。
3. **数据绑定**：把原始素材绑定到 control，目标素材绑定到 targets。
4. **文字条件**：填写默认转换描述，或使用已经准备好的逐条描述。
5. **采样内容**：替换示例路径和提示词，使用自己的素材检查效果。

图片和视频任务的配置也不同。视频演示的纯图片任务没有音频，frame count 使用 1；如果输入的是视频，不要把这一组图片设置原样套过去。参考图与参考视频对应的输入类型也要选择正确。

## 5. 训练适配器和保留能力的方法，不要混着开

视频比较了不同适配器及训练方法，也提到了使用教师模型保留原模型能力的方式。这些选项影响训练行为和耗时，不是越多越好。

其中 circlestone-labs 的图片训练适配器有明确限制：使用时不应同时开启 CFG 增强训练或 guidance preservation loss。作者资料的这个限制应优先于“把效果相关选项全部打开”的直觉。

第一次运行时，使用教程中**同一套相互匹配的配置**，先跑通数据与采样。更换适配器时，重新核对训练方法，而不只是替换一个文件路径。

## 6. Rank、步数和显存设置

| 项目 | 视频中的例子 | 怎么理解 |
| --- | --- | --- |
| LoRA rank | 16 或 32 | 本期提供的候选值，按自己的任务比较 |
| 训练步数 | 示例设为 5000 | 是训练计划，不代表最佳版本一定在最后 |
| 检查点保留 | 演示保留 10 个 | 方便回看中途效果，避免只剩最新版本 |
| Offloading | 根据显卡调整 | 用时间和数据搬运换取显存空间 |
| 分辨率 | 显存不足时降低 | 图片、视频和参考输入都会影响占用 |

不要把视频里 H20 的迭代速度当作自己机器的预期。先用自己的素材跑一次缓存、采样和短训练，确认资源够用，再延长任务。

## 7. 下载 LoRA，并回看训练是否符合目标

训练开始后观察样片，完成后下载 LoRA。编辑任务重点检查转换是否实现，以及人物、姿势和内容是否保留；复杂视频概念还要看动作与参考约束是否学对。

如果结果逐渐变成了不想要的“美颜感”或其他固定风格，先回看目标素材。视频中已经出现过训练结果受到这类数据倾向影响的情况。

另一套配对编辑训练的具体操作见 [Qwen Image 2.1 编辑 LoRA：二次元转真人](qwen-image-2-1-lora-training.md)；两者的数据组织思路可以对照，但模型与训练配置不能直接互换。

## 资源

- [原视频](https://www.bilibili.com/video/BV1foe26JE1h)
- [AI Toolkit 项目](https://github.com/ostris/ai-toolkit)
- [H3 图片训练适配器](https://huggingface.co/circlestone-labs/MiniMax-H3-Image-Training-Adapter)
- [H3 模式与帧数技术说明](https://github.com/AkaneTendo25/musubi-tuner/blob/minimax-h3/docs/minimax_h3.md)
