---
id: musubi-h3-anime-lora
title: 用 Musubi Tuner 训练 H3 番剧风格 LoRA
topic: LoRA训练
aliases:
- 番剧风格训练
- 芙莉莲
- Musubi Tuner
applicability: []
publish: true
---

想让 H3 生成的视频带有某部番剧的画风，可以先从图片数据集训练风格 LoRA。这篇教程以视频里的《芙莉莲》示例为线索，完整整理素材筛选、打标、训练适配器、低显存配置、缓存和采样检查。

对应 [9 月 25 日的视频教程](https://www.bilibili.com/video/BV1teau6XEM7)。演示使用的是带 H3 功能的 Musubi Tuner 分支及配套云端镜像；界面中的模型路径与预设是该镜像提供的，本地安装时需要换成自己的路径。

## 训练前先准备好这些

| 项目 | 需要准备的内容 |
| --- | --- |
| 训练工具 | 视频使用的 Musubi Tuner H3 分支 |
| 模型 | 与训练任务对应的 H3 模型、文本编码器和 VAE |
| 数据集 | 清洗后的番剧图片，以及对应的描述文本 |
| 训练适配器 | circlestone-labs 的 H3 图片训练适配器 |
| 测试内容 | 能比较画风、人物和动作表现的采样提示词 |

视频使用 4090 演示配置调整，完整训练还使用过 H20。作者更倾向在较充裕的显存下训练；如果你用的是 24GB 设备，后面的量化、分辨率与交换设置尤其重要。

## 1. 数据集要覆盖画风，而不是只堆同一个人物

视频里的数据集约有 400 张图片，作者给出的经验范围是 350–500 张。整理时比数量更重要的是：这些图片能不能代表这部作品的画风。

选图时覆盖不同的：

- 角色和人物组合；
- 近景、中景、远景；
- 人物姿势、表情和镜头角度；
- 室内、室外和没有人物的空镜。

从视频提取图片后，删除高度相似的连续帧，并去掉字幕文字等干扰。如果整批素材几乎都是同一个角色和构图，训练得到的结果容易把人物特征与画风绑在一起，换个场景就不好用了。

已有截图合集也要经过筛选。视频中这一步花了不少时间，不能因为图片已经下载好，就把“有数据”当成“数据整理完成”。

## 2. 打标：触发词在前，画面内容在后

本教程的做法是给每张图配一个描述，前面放风格 LoRA 的触发词，后面写图里有哪些人物、在做什么、是什么场景。

如果一张图中有多位角色，就把角色区分清楚。视频里的例子会分别描述人物，让模型能把角色名字与对应的外观关联起来。

训练特定番剧画风时，作者没有在每条描述里反复添加泛泛的“动漫风格”词，而是描述具体内容，让作品共同的风格由数据本身体现。这是本次风格训练采用的打标思路。

打标后抽查几组图片和文本，重点看角色是否串名、人物数量是否正确，以及描述里有没有图中不存在的东西。

## 3. 图片训练适配器是做什么的

H3 最终要生成视频，但本次使用图片学习画风。直接进行纯图片训练时，除了学到目标风格，也可能改变原有的视频表现，出现动作变弱、画面像幻灯片的问题。

circlestone-labs 的适配器就是为这一训练方向设计的。按照[作者说明](https://huggingface.co/circlestone-labs/MiniMax-H3-Image-Training-Adapter)，训练前将它融入基础模型，再在其上训练 LoRA；推理使用训练结果时，不再带这个训练适配器。

使用它时，**不要叠加 CFG 增强训练或 guidance preservation loss**。它与这些方法的组合有限制，不能看到训练器里有开关就全部打开。作者也明确说过，对视频与图视频混合训练的测试较少。

## 4. 先把预设调整到自己的显存范围

视频中的默认配置来自 H20，直接拿到 4090 上会出现显存警告。需要分别检查数据集、缓存和训练三个部分。

### 数据集与分辨率

把图片和描述放到自己的数据集目录，并让训练任务指向它。不要保留示例素材路径。

显存紧张时先降低训练分辨率。视频演示了向 768 或 1024 级别调整的思路；这里先让缓存和采样完整运行，再逐步提高画面尺寸。

### 文本编码器与训练精度

文本编码器缓存和模型训练是两个阶段，**一个阶段能放进显存，不代表另一个阶段也能运行**。

视频在 24GB 环境下切换了低显存的文本编码器配置，并在训练端使用 INT8 相关选项。字幕中的格式名称经作者分支文档核对为 **NVFP4**；它不是需要照着误识别文字手工拼出来的模型名。具体格式与文件对应关系看[分支的 H3 文档](https://github.com/AkaneTendo25/musubi-tuner/blob/minimax-h3/docs/minimax_h3.md#model-download)。

### Block swap

Block swap 将部分模型权重在内存和显存之间交换，能降低权重的显存占用，但也有传输开销。视频中观察显存提示后，使用过 20 的交换数量；这不是所有数据都固定填写的值。

先确认模型和素材对应的预估占用，再调整交换数量。如果主要压力来自高分辨率或很长的序列，还需要降低这些输入规模，不能只增加交换。

## 5. 按顺序缓存，然后开始训练

准备完成后，按视频里的顺序执行：

1. **缓存 latent**：处理训练图片对应的潜空间数据。
2. **缓存文本编码器输出**：处理图片描述的文本条件。
3. **启动训练**：使用前两步生成的缓存。

其中一步失败时，先处理该阶段的路径或显存问题，再继续下一步。视频的界面可以分步执行，也提供连续启动的入口。

## 6. 在训练开始时就检查采样

生成样片还会额外占用显存。若直到训练中途保存时才第一次采样，可能前面的训练正常，到了采样环节才失败。

需要训练样片时，启用起始采样，先确认它能生成。采样提示词、宽高、帧数和种子都换成自己的测试内容；不要一直用预设里别人的测试题材。

如果不需要训练中采样，也可以关闭这一环节，训练后再到 ComfyUI 比较不同版本。

## 7. 不一定选最后一个检查点

视频设置了 20000 步，但作者观察到约 16000 步时已经可用，继续训练后反而削弱了动态。因此挑选 LoRA 时，要同时比较画风和运动表现，不能只看某张静帧越来越像原作。

保留中途版本，用同一组提示词比较不同检查点。视频使用很少的图片演示启动速度，那一段不能拿来估算完整数据集的训练耗时。

如果你要训练的是参考图、视频编辑或复杂概念，而不只是番剧画风，可以接着看 [用 AI Toolkit 训练 H3 参考生视频与编辑 LoRA](h3-lora-training-modes.md)。

## 资源

- [原视频](https://www.bilibili.com/video/BV1teau6XEM7)
- [Musubi Tuner H3 分支](https://github.com/AkaneTendo25/musubi-tuner)
- [H3 图片训练适配器](https://huggingface.co/circlestone-labs/MiniMax-H3-Image-Training-Adapter)
- [视频配套云端镜像](https://www.compshare.cn/images/45fjRt6lPDqa)
