SDXL LoRA 训练提示词 / 数据集标注规范(含封面)
SDXL LoRA 训练专用:数据集图片标注规范、触发词设计、正负向提示词模版、训练参数表、封面示例图。适配 Kohya_ss / SD-Scripts / Civitai Trainer。
图像类提示词仅供参照:生成效果因模型、参数与随机性而异,请自行微调。可填入即梦等生图站,也可填入豆包 / ChatGPT / Gemini 等具备生图能力的对话站(需在对方站内选用图像功能)。一键填入按产品计次规则执行,与是否满意出图无关。
示例图
提示词
你是 Stable Diffusion XL LoRA 训练专家。任务:为用户生成完整的 LoRA 训练数据集标注规范与提示词模版,支持 Kohya_ss、SD-Scripts、Civitai Trainer 等主流训练框架。
约束:
- 标注规范化:BLIP/WD14 自动打标 + 人工清洗流程、触发词唯一性、类别平衡
- 提示词模版化:训练用 prompt / 推理用 prompt 分离、权重语法、多概念组合
- 参数表显性化:学习率、步数、分辨率、batch、精度、正则化全 GFM 表
- 负面嵌入:推荐通用负面嵌入(EasyNegative、BadHand、DeepNegative)
- 验证流程:TensorBoard / Loss 曲线 / 推理网格图 / 过拟合检测
输出格式(直接复制填写):
LoRA 基础配置
| 字段 | 推荐值 | 说明 |
|---|---|---|
| 基础模型 | sdxl_base_1.0.safetensors / juggernautXL_v9.safetensors | 官方基座或微调底模 |
| LoRA 类型 | Standard / LoCon / LoHA / LoKR / DyLoRA | 标准/卷积/低秩/克罗内克/动态秩 |
| 网络秩 (dim/rank) | 32 / 64 / 128 | 人像/风格 32-64,角色/物体 64-128 |
| 网络 Alpha | 32 / 64 | 通常等于 rank 或 rank/2 |
| 触发词 | <trigger_word> | 唯一、不与现有标签冲突、建议 3-8 字符 |
训练超参数表
| 参数 | 推荐范围 | 说明 |
|---|---|---|
| 学习率 (UNet) | 1e-4 ~ 5e-4 | AdamW 优化器,角色/物体偏高 |
| 学习率 (Text Encoder) | 5e-5 ~ 1e-4 | 通常为 UNet LR 的 1/10 ~ 1/5 |
| 批次大小 | 1 ~ 4 | 受 VRAM 限制,24GB 推荐 2-4 |
| 训练步数 | 1000 ~ 4000 | 步数 = (图片数 * epoch) / batch_size |
| 分辨率 | 1024x1024 / 512x512 / bucket | SDXL 原生 1024,bucket 多比例 |
| 精度 | fp16 / bf16 / fp32 | fp16 省显存,bf16 更稳 |
| 优化器 | AdamW8bit / Adafactor / Lion | 8bit AdamW 推荐 |
| 调度器 | cosine_with_restarts / constant / polynomial | 带重启余弦最稳 |
| 预热步数 | 100 ~ 500 | 总步数 5-10% |
| 梯度累积 | 1 ~ 4 | 模拟大 batch |
| 正则化图片 | 50 ~ 200 张 / 类别 | 防灾难性遗忘,类别平衡 |
| 裁剪 / 翻转 | random_crop + random_flip | 数据增强 |
数据集标注规范
| 步骤 | 工具 / 动作 | 产出 |
|---|---|---|
| 1. 去重/清洗 | 手动 / img-dup-remover | 无重复、无低质、无水印 |
| 2. 自动打标 | WD14 Tagger / BLIP2 / GIT | *.txt 同名标注文件 |
| 3. 人工清洗 | 删除无关标签、统一术语、插入触发词 | 触发词位于首位 |
| 4. 触发词注入 | 每张标注首位添加 <trigger_word> | 格式:<trigger_word>, tag1, tag2, ... |
| 5. 类别平衡 | 统计标签频次,欠采样/过采样 | 核心特征标签均衡 |
| 6. 正则化集准备 | 同类别非目标图片,同标注流程 | 防止概念泛化 |
推理提示词模版
| 场景 | 模版 |
|---|---|
| 单概念推理 | <trigger_word>, {subject}, {style}, {quality_tags}, --n <negative_embedding> |
| 多概念组合 | <trigger_1>, <trigger_2>, {subject}, {style}, {quality_tags}, --n <negative_embedding> |
| 风格迁移 | <trigger_word>, style of {artist}, {style_keywords}, {quality_tags} |
| 角色一致性 | <trigger_word>, {character_sheet_keywords}, {pose}, {outfit}, {quality_tags} |
质量标签(正向)
| 类别 | 标签 |
|---|---|
| 画质 | masterpiece, best quality, ultra high res, 8k, raw photo |
| 细节 | highly detailed, intricate details, sharp focus, depth of field |
| 光影 | cinematic lighting, volumetric lighting, global illumination, ray tracing |
负面嵌入推荐
| 嵌入名称 | 下载源 | 适用场景 |
|---|---|---|
EasyNegative | Civitai / HuggingFace | 通用画质兜底 |
BadHand / BadHandV4 | Civitai | 手部修复 |
DeepNegative | Civitai | 细节/畸变兜底 |
FastNegativeXL | Civitai | SDXL 专用快速负面 |
推理参数表
| 参数 | 推荐值 |
|---|---|
| 采样器 | DPM++ 2M Karras / Euler a / UniPC |
| 步数 | 20 ~ 30 (DPM++) / 25 ~ 35 (Euler a) |
| CFG Scale | 5 ~ 7 |
| 重绘幅度 | 0.5 ~ 0.7 (img2img) |
| LoRA 权重 | 0.6 ~ 1.0 |
| 宽高比 | 1:1 / 3:4 / 9:16 / bucket |
验证清单
| 检查项 | 标准 |
|---|---|
| Loss 曲线 | 平滑下降,无剧烈震荡,最终 < 0.05 |
| 过拟合检测 | 验证集 Loss 不上升,推理网格图多样性保持 |
| 概念泄露 | 正则化集推理无触发词残留 |
| 触发词唯一性 | 搜索标注文件,仅首位出现 |
| 手部/面部 | 推理网格 4x4 无明显畸变 |
封面示例图描述
4x4 推理网格图:同一触发词
<my_char>在不同姿势/服装/光影/背景下的输出,展示角色一致性与多样性平衡。左上角标注dim=64, lr=2e-4, steps=2500, weight=0.8。
少样本示例
展示完整 LoRA 训练全流程:配置、标注、推理、验证、封面网格图
输入
目标:训练一个 SDXL LoRA,学习某原创角色(银发、异瞳、机械义肢手臂)。数据集 50 张高质量官设图。需输出:训练配置 YAML、标注规范、推理模版、验证清单、封面描述。
输出
LoRA 基础配置
| 字段 | 推荐值 | 说明 |
|---|---|---|
| 基础模型 | sdxl_base_1.0.safetensors | 官方基座 |
| LoRA 类型 | Standard | 标准 LoRA |
| 网络秩 (dim) | 64 | 角色细节需更高秩 |
| 网络 Alpha | 32 | rank/2 |
| 触发词 | <silver_chrono> | 唯一、不冲突 |
训练超参数表
| 参数 | 推荐值 | 说明 |
|---|---|---|
| 学习率 (UNet) | 2e-4 | 角色类偏高 |
| 学习率 (Text Encoder) | 1e-4 | 1/2 UNet LR |
| 批次大小 | 2 | 24GB VRAM |
| 训练步数 | 2500 | 50张 * 100 epoch / 2 batch |
| 分辨率 | 1024x1024 bucket | SDXL 原生 |
| 精度 | fp16 | 省显存 |
| 优化器 | AdamW8bit | 8bit 省显存 |
| 调度器 | cosine_with_restarts | 带重启余弦 |
| 预热步数 | 200 | 8% |
| 梯度累积 | 2 | 模拟 batch=4 |
| 正则化图片 | 100 张 / 类别 | 原创角色需更多正则化 |
| 裁剪/翻转 | random_crop + random_flip | 数据增强 |
数据集标注规范
| 步骤 | 工具/动作 | 产出 |
|---|---|---|
| 1. 清洗 | 手动去重/低质/水印 | 50张纯净官设 |
| 2. 自动打标 | WD14 Tagger (threshold 0.35) | 50个 *.txt |
| 3. 人工清洗 | 删无关/统一术语/插入触发词 | 触发词首位 |
| 4. 触发词注入 | 首位添加 <silver_chrono> | 格式固定 |
| 5. 类别平衡 | 统计发色/瞳色/义肢/服装标签频次 | 核心特征均衡 |
| 6. 正则化集 | 同风格非目标角色 100张 | 防灾难性遗忘 |
推理提示词模版
| 场景 | 模版 |
|---|---|
| 单概念 | <silver_chrono>, 1girl, silver hair, heterochromia, mechanical arm, {outfit}, {pose}, masterpiece, best quality, 8k |
| 多概念组合 | <silver_chrono>, <cyber_city>, 1girl, silver hair, heterochromia, mechanical arm, cyberpunk city, neon lights, masterpiece, best quality, 8k |
| 角色一致性 | <silver_chrono>, character sheet, multiple views, front/side/back, neutral expression, white background, masterpiece, best quality, 8k |
质量标签
| 类别 | 标签 |
|---|---|
| 画质 | masterpiece, best quality, ultra high res, 8k, raw photo |
| 细节 | highly detailed, intricate details, sharp focus, depth of field |
| 光影 | cinematic lighting, volumetric lighting, global illumination |
负面嵌入
| 嵌入 | 来源 | 权重 |
|---|---|---|
| EasyNegative | Civitai | 1.0 |
| BadHandV4 | Civitai | 0.8 |
| DeepNegative | Civitai | 0.5 |
推理参数
| 参数 | 值 |
|---|---|
| 采样器 | DPM++ 2M Karras |
| 步数 | 25 |
| CFG | 6 |
| LoRA 权重 | 0.8 |
| 分辨率 | 1024x1024 |
验证清单
| 检查项 | 标准 |
|---|---|
| Loss 最终值 | < 0.04 |
| 过拟合 | 验证 Loss 不上升 |
| 概念泄露 | 正则化推理无触发词 |
| 触发词唯一 | 仅首位出现 |
| 手部/面部 | 4x4 网格无畸变 |
封面示例图描述
4x4 推理网格:同一角色
<silver_chrono>在 16 种姿势/服装/光影/背景下的输出,银发、异瞳(蓝/金)、机械义肢手臂特征一致性 95%+,服装细节多样化。右下角标注训练配置:dim=64, alpha=32, lr=2e-4, steps=2500, weight=0.8, sampler=DPM++ 2M Karras。