RVC WebUI 语音克隆搭建:从十分钟录音到实时变声

发布时间:2026/9/20 2:23:31
RVC WebUI 语音克隆搭建:从十分钟录音到实时变声 RVC WebUI 语音克隆搭建从十分钟录音到实时变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI如果你在游戏直播里想实时换掉自己的嗓音或者想把一首翻唱里的人声换成另一位歌手的音色RVC WebUIRetrieval-based-Voice-Conversion-WebUI是目前最常用的开源方案之一。它是一个语音音色转换/变声框架先准备一段目标人声录音训练出色调模型之后就能把任意输入音频转换成那个音色。它对训练数据的要求不高官方建议至少准备 10 分钟的低底噪录音。使用场景与工作原理RVC 带两个入口对应两类用法离线训练与转换python webui.py启动网页界面默认端口 7865在里面完成数据集处理、模型训练、离线推理和人声伴奏分离实时变声运行realtime_gui.pyWindows 对应 go-realtime_gui.bat 快捷方式端到端延迟约 170ms使用 ASIO 输入输出设备可压到 90ms。原理上它做的是检索式音色替换推理时用 top1 检索把输入音频的音色特征替换成训练集里目标人声的特征目的就是杜绝音色泄漏——输出结果带上输入源音频音色的现象。音高提取采用 RMVPE 算法Interspeech 2023速度快、资源占用小仓库还集成了 UVR5可以先从歌曲里分离出纯人声再转换。训练代码在 train/推理代码在 infer/。环境搭建依赖按硬件区分当前分支面向 Python 3.12 x64服务器推荐 Ubuntu 24.04。建好虚拟环境后按硬件安装对应的依赖清单CPU / AMD / Intel装requirments_cpu_py312.txtWindows 可用 DirectMLLinux 走 CPUNVIDIA RTX 50 系先装 cu128 版 Torch再装requirments_cu128_py312.txt更早的 RTX 卡先装 cu118 版 Torch再装requirments_cu118_py312.txt。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirments_cpu_py312.txt python webui.py模型文件不包含在仓库里需要从 Hugging Face 下载到assets/的对应子目录hubert_base/供特征提取rmvpe/rmvpe.pt供音高提取pretrained/与pretrained_v2/是 v1/v2 训练用的底模。只跑推理和特征提取的话最小集合是下面两条命令python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpewebui 会自动创建运行目录启动后按控制台提示打开浏览器即可无桌面的服务器加--noautoopen参数。训练集录制与一键训练录音时长方面官方 FAQ 的口径是 10 到 50 分钟如果音色特征鲜明、底噪低5 到 10 分钟也能出可用模型。录制有三点要注意环境安静、控制底噪音频文件夹路径不要出现中文、空格、括号这类字符ffmpeg 读路径时特殊字符会直接报错中文路径写 filelist 时还可能出 utf8 错误。音频放进一个文件夹后在 WebUI 里走一键训练先数据集处理切片、提取音高和特征再训练模型索引也会自动建立。关键参数是 total_epoch底噪大的数据20 到 30 轮足够调太高只会把结果拖向训练集的音质音质高、时长长的数据可以加到 200 轮。训练完注意模型存放位置logs/实验名/下几百 MB 的文件是实验状态用于复现和继续训练不是拿来推理的真正能推理、能分享的是assets/weights/里 60 多 MB 的 pth 文件和对应放在assets/indices/的.index索引。想微调音色时可以在 ckpt 选项卡用 ckpt-merge 把两个模型按比例融合。推理参数怎么调index_rate 与精度最值得一说的是 index_rate它控制检索混入训练集特征的比例。调到 1理论上不存在音色泄漏但输出音质会倾向训练集——如果训练集音质低于推理源反而拉低质量调到 0则没有检索混合的保护。如果训练集本身优质、时长多音色泄漏本来就不多见这个参数就不那么重要了。精度方面基本由程序自动决定较新的 CUDA 卡用 fp16Pascal 架构和 GTX 16 系用 fp32显存不足 4GB 或架构低于 SM 5.3 的卡会退回 CPU。显存的底线是4GB 以下基本可以放弃4GB 勉强够用。实时变声时输入输出设备选同一类型例如都用 MME否则延迟和稳定性都会受影响。常见报错与排坑ffmpeg error / utf8 error多数不是 ffmpeg 本身的问题而是音频路径带空格、括号或中文换个干净路径再试。Cuda out of memory训练时缩小 batch size推理时酌情调小configs/config.py结尾的 x_pad、x_query、x_center、x_max。一键训练结束没有索引控制台打印 Training is done 就说明模型已训好紧邻的报错是假的重新点一次训练索引即可。训练中断目前只能关闭控制台重启程序网页参数重新填写后用相同参数点训练模型会从上次 checkpoint 继续。建议第一次先按默认参数跑通10 分钟录音 → 一键训练 → 离线推理完整流程记下效果最好的 index_rate 与 total_epoch 组合再逐步调优。遇到报错优先翻 docs/cn/faq.md大部分能搜到的报错在那里都写了处理方式各版本改了什么可以看 docs/cn/Changelog_CN.md。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询