如何用 AMD 显卡训练 AI 绘画模型:kohya_ss 与 ROCm 完整实战指南

发布时间:2026/9/13 12:26:23
如何用 AMD 显卡训练 AI 绘画模型:kohya_ss 与 ROCm 完整实战指南 如何用 AMD 显卡训练 AI 绘画模型kohya_ss 与 ROCm 完整实战指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss很多人以为 AMD 显卡只能打游戏跑 AI 训练是 NVIDIA 的专属领地。其实这套组合拳已经打通了kohya_ss是一个开源的 Stable Diffusion 训练工具带图形界面而ROCm是 AMD 为自家 GPU 打造的计算软件栈可以理解为 AMD 版的 CUDA。两者配合你就能用自己的 RX 系列显卡低成本地训练 LoRA、微调模型让 Stable Diffusion 学会你想要的画风或角色。快速上手从装驱动到打开界面走完这一节你就能在自己机器上打开一个可训练 Stable Diffusion 的图形界面离跑通第一次训练只差一张数据集。先确认你的硬件底子一块 RX 6000/7000 系列的显卡16GB 显存更从容、Ubuntu 22.04、32GB 内存。第一步装好 ROCm 驱动只需三步。装好驱动后你的显卡才对 Python 生态可见sudo apt update sudo apt install rocm-hip-sdk sudo usermod -a -G video $USER # 把当前用户加入 video 组改完注销重登生效装完后运行rocminfo能打印出你的 GPU 型号就说明驱动 OK 了。第二步拉取代码。kohya_ss 提供了 ROCm 专用的依赖清单 requirements_linux_rocm.txt里面锁定的是torch2.7.1rocm6.3这类 AMD 专属编译包普通pip install torch装到的 CUDA 版在 AMD 卡上是跑不起来的。git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss--recursive别漏它负责拉取训练脚本等子模块。第三步一条命令装环境 启动界面。setup.sh脚本会自动检测 ROCm如果装过驱动能发现rocminfo就直接走 ROCm 依赖你也可以显式指定./setup.sh --use-rocm # 按 AMD GPU 安装依赖 ./gui.sh # 启动训练图形界面界面起来后浏览器里就是一个填参数、点按钮的训练控制台后面所有调优都在里面完成。原理拆解 kohya_ss 是怎么帮你省事的读完这一节你会明白这个工具里那些看不见的旋钮各自在管什么调参时不再靠猜。一句话理解 LoRA它不是重训整个大模型而是给模型贴一层薄薄的补丁用 1% 左右的参数量教会模型一个新概念省卡又省时。这也是为什么它成了 AMD 卡上的主力玩法。GUI 只是翻译官真正的活儿是 kohya_gui/ 里一堆模块生成的命令行指令。比如 kohya_gui/lora_gui.py 把你点选的维度、学习率翻译成底层训练脚本能懂的参数——所以你不用背命令填表就行。显存的两个生活化旋钮对应 config example.toml 里的设置缓存潜变量cache_latents true就像提前把菜洗好切好放冰箱训练时不用每次重新读图显存换时间。梯度检查点gradient_checkpointing好比记账时不抄全账本、需要时重算一遍——多用一点计算换回一大块显存是 AMD 卡上防爆显存的常客。精度与优化器mixed_precision fp16让模型用半精度跑显存直接砍半optimizer AdamW8bit再把优化器状态压到 8 位进一步给显存减负。AMD 卡上不推荐 xformers开启mem_eff_attn true内存高效注意力即可。![AMD 显卡训练 Stable Diffusion 用的示例数据集机械与生物融合的蒸汽朋克风格人物](https://raw.gitcode.com/GitHub_Trending/ko/kohya_ss/raw/f44226cfccca008094f958d829c49c74a7e9289d/test/img/10_darius kawasaki person/Dariusz_Zawadzki.jpg?utm_sourcegitcode_repo_files)上面这张来自仓库自带的测试数据集 test/img/配套的 .txt 标注文件就是训练时的教材注释实战调优跑通第一个 LoRA 再逐步提速这一节是一条完整路径先跑通再提速。跟着走你能得到一个风格化的 LoRA 权重文件。准备数据按图片 同名 .txt 标注组织成文件夹比如dataset/concept1/下放 20-50 张图。懒得手写标注仓库提供了 BLIP 自动标注入口见 kohya_gui/blip_caption_gui.py批量生成描述文件省掉手工活。填参数并开训在 LoRA 选项卡里新手记住这几个默认值就够起步——network_dim32、network_alpha16、学习率1e-4、batch size 按显存定16GB 卡建议 2-4 起步。点开始界面会把参数存进配置文件并自动执行训练。这是 test/masked_loss/ 里的掩码示例白色区域告诉模型重点学这里属于进阶玩法跑起来之后按这个顺序提速爆显存→ 先开梯度检查点再开潜变量缓存还不够就把 batch size 降到 1同时把gradient_accumulation_steps调到 2-4 模拟大批量训练偏慢→ 确认 fp16 已开AMD 卡首选 fp16部分 7000 系卡可试 bf16优化器换成 AdamW8bit效果不稳→ 用分阶段学习率前 10% 步数用小学习率如lr_warmup预热主体按 1e-4 跑末段靠 cosine 调度自然衰减。所有训练过程都能通过 TensorBoard 观察配置里log_with填tensorboardloss 曲线平稳下降、采样图风格渐显就说明方向对了。避坑与进阶多卡、容器化和后续方向最后一节帮你绕开常见坑并指好进阶路线。高频问题速查现象大概率原因处理办法torch.cuda.is_available()返回 FalseROCm 驱动没装好或没注销重登跑rocminfo检查确认用户已在 video 组训练中爆显存单次计算量超过容量按检查点 → 缓存 → 降 batch → 降分辨率顺序降级训练特别慢精度/优化器没调开 fp16 AdamW8bit别期待 xformers界面起不来没先跑 setup 或 venv 没激活先./setup.sh --use-rocm再看 docs/Installation/ 各平台说明双卡及以上用户AMD 上指定显卡用HIP_VISIBLE_DEVICES0,1环境变量kohya_ss 支持通过 accelerate 启动多进程在 kohya_gui/class_accelerate_launch.py 对应的 Accelerate 选项卡里填num_processes和 GPU ID 即可。单卡用户请忽略此节别提前给自己加戏。服务器或团队环境直接看 Docker 方案docs/installation_docker.md在容器里预装 ROCm 镜像 requirements_linux_rocm.txt一条命令复现环境省去本机折腾。往后看ROCm 生态仍在快速迭代FP8 低精度训练、多节点扩展都是值得跟进的方向仓库的 docs/ 与 presets/ 里沉淀了大量社区调优配方卡住时先翻这两个目录大概率有人踩过同样的坑。到这里你的 AMD 显卡已经从只能打游戏升级成能训模型的算力了。下一步建议拿仓库里的 examples/ 脚本对照一遍命令行参数把 GUI 里每个按钮背后的真实命令看个明白——到那时调参就不再是玄学。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询