尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Kohya_ss Flux LoRA 训练快速上手:从打开开关到跑通省显存配置

Kohya_ss Flux LoRA 训练快速上手:从打开开关到跑通省显存配置 Kohya_ss Flux LoRA 训练快速上手从打开开关到跑通省显存配置【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss想在 Kohya_ss 里对 Flux.1 做 LoRA 微调本文给出一条能直接跑通的最短路径Flux.1 训练开关在哪里打开、预设怎么选、哪些参数先别动、训练启动后怎么确认一切正常。面向第一次接触 Flux 训练的用户假设你已装好 GUI 环境目标是完成一次可验收的首次训练。什么时候需要用它你的目标是给 Flux.1 基础模型做个性化 LoRA而不是 SD1.5 或 SDXL。Kohya_ss 的 Flux 训练走的是独立的网络训练入口参数体系文本编码器组合、流匹配调度与老模型完全不同必须用对应配置。你希望一套界面完成选基础模型—填数据目录—出模型的流程不想手写命令行参数。你显存有限。预设里默认带上了 fp8 基础模型、文本编码器缓存等省显存开关16GB 起步的卡有较大概率跑通 batch size 为 1 的训练。启动前准备按清单逐项核对缺一样都会卡住硬件建议 16GB 及以上显存内存 32GB 更从容文本编码器缓存会吃内存。基础模型flux1-dev.safetensors 主模型的完整路径。三个配套模型文件CLIP-Lclip_l.safetensors、T5-XXL建议用 fp16 版本、VAEae.sft。Flux.1 标准版需要这三件套只有当你训练 Chroma/schnell 系时才不需要 CLIP-L。训练数据图片文件夹 每张图同名的 .txt 标注文件文件夹名可带权重前缀例如10_your_name数字越大该组图片被采样的权重越高。输出目录放 LoRA 结果和采样图的空目录路径别带中文和空格更省心。最短路径配置Kohya_ss Flux 训练模式怎么开启在 GUI 的 LoRA 训练页勾选 Flux.1 开关右侧会展开 Flux.1 配置区同时在预设下拉框里选择仓库自带的 Flux 预设flux1D - adamw8bit fp8一次带出全部推荐参数再手动补齐五处路径即可pretrained_model_name_or_path: flux1-dev.safetensors 完整路径 clip_l: CLIP-L 完整路径 t5xxl: T5-XXL 完整路径 ae: VAE 完整路径 train_data_dir: 图片文件夹路径第一次训练先别动的参数fp8_base、mixed_precision保持 bf16、gradient_checkpointing、train_batch_size保持 1、network_dim/network_alpha保持 16/16。预设里这些值已经过平衡同时改多个只会让你无法判断是哪个起了作用。关键参数理解只列会影响结果、值得理解的几项其余保持预设值。learning_rate预设 0.0003调大收敛快但容易过拟合、损失抖动调小更稳但需要更多步数。第一次失败后优先从这里减半排查。max_train_steps预设 1000调大更贴合训练图、更容易过拟合十几张图从 1000 以内起步靠采样图判断而不是靠步数猜。train_batch_size预设 1Flux 单卡显存占用高保持 1显存富余才考虑加到 2 并相应减步数。fp8_basemixed_precisionfp8_base 就是用低精度装载基础模型用一点数值精度换显存混合精度保持 bf16不建议改成 fp16。discrete_flow_shift预设 3调度器采样时的噪声偏移默认 3 即可只有你同时改动采样方案时才碰它。model_prediction_type预设 raw与timestep_sampling预设 sigmoid分别决定模型输出解释方式和训练时间步采样策略保持预设值。guidance_scale影响采样图的引导强度调大更贴提示词但容易过饱和这只作用于训练中出的样本图不影响 LoRA 本体。参数定义与默认值可对照 Flux GUI 配置源码 核对。跑通训练后如何验证三个验收点都满足才算真正跑通启动阶段日志顺利加载 U-Net、CLIP-L、T5-XXL、VAE 四个组件进入逐步训练而不是加载到一半报错退出。采样图把sample_every_n_steps设成 100 左右预设为 0 即不采样建议首训打开到点检查输出目录里生成的图片应能看出开始向训练对象靠拢。输出产物output_dir下按save_every_n_steps预设 50周期性出现.safetensorscheckpoint日志里的 loss 前几百步应平稳下降没有 NaN 或断崖式飙升。常见报错与处理显存不足OOM现象训练中某一步直接崩溃报 CUDA out of memory。 处理顺序确认train_batch_size1→ 降低max_resolution→ 打开Cache Text Encoder Outputs和...to Disk→ 确认fp8_base已开 → 仍不行再启用 CPU Offload Checkpointing 或 block swap 这类实验项。Flux 训练显存不足怎么办绝大多数情况前两步就能解决。模型加载失败现象启动时某一步报找不到文件或加载错误。 处理逐一核对五处路径是否为完整绝对路径T5-XXL 确认用的是 fp16 版本文件Chroma 类型下 CLIP-L 可不填但选错Base Model Type也会报缺文件。损失异常或 NaN现象loss 突然飙升或变 NaN。 处理先减半学习率重跑再检查数据目录里有没有错放的图没有配对 .txt 的图、损坏图确认max_grad_norm保持 1。采样图几乎不变现象跑了几百步采样图看不出差别。 处理对照标注文件确认触发词与sample_prompts里一致检查训练步数是否够确认数据文件夹权重前缀没有被忽略成 0。进阶优化只在首训跑通之后再考虑文本编码器缓存到磁盘flux1_cache_text_encoder_outputs_to_disk避免每步重复编码磁盘空间够就值得打开。train_blocks设为 double 或 single只训练双块或单块部分显存和速度都有改善代价是表达能力变弱适合小数据。CPU Offload Checkpointing、Single/Double Blocks to swap均标注实验性质显存实在不够时作为最后手段。Fused Backward Pass仅支持 Adafactor 优化器属于微调模式下的省显存选项与 AdamW8bit 预设不搭配。采样频率sample_every_n_steps与save_every_n_steps分开调采样是验证手段别开太密拖慢训练。下一步建议先用预设跑通一次默认配置并确认采样图有效之后每次只改一个参数并记录改动与结果。跑顺之后再去 LoRA 文档 对照自己的数据规模调步数和学习率。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表