RVC AI 变声教程:三步跑通部署,练出你的第一个语音转换模型

发布时间:2026/9/1 14:21:42
RVC AI 变声教程:三步跑通部署,练出你的第一个语音转换模型 RVC AI 变声教程三步跑通部署练出你的第一个语音转换模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC 是一个基于 VITS 的开源语音转换项目喂给它 10 分钟某个人的低底噪录音训出一个音色模型之后你说的任何话都能变成那个音色相当于在家拥有一台 AI 变声引擎。本教程带你依次完成装环境、启动界面、训出第一个模型、变出第一段声音。效果先睹按本文做完之后你能做到这三件事视频配音用 10-50 分钟目标人物的干净语音训练后任意台词都能用该人物音色生成单次推理几秒出片不满意可反复重生成。游戏与直播语音实时变声模式的端到端延迟为 170ms配 ASIO 声卡可降到 90ms对方听到你的语气音色却是目标人物。一句话原理RVC 用检索式方法把原声音里的音色特征替换成目标音色的特征。你的语气和情绪保留换的只是嗓子的质地。效果上限主要看训练数据录音底噪越低转换结果越接近本人。跑起来之前要准备什么前置项分三组按顺序检查即可系统要求Python 3.8 以上必装显存 4G 及以上的显卡推荐训练、推理都够用显存更小的卡或纯 CPU 只能做推理速度较慢操作系统Windows、Linux、macOS 均支持模型文件必装但无需手动下载项目自带一键下载脚本会把语音特征提取、v1/v2 预训练模型、人声分离、音高提取这几类模型自动放到assets/对应位置其中 v2 预训练模型是训练时的默认选择音频工具 FFmpeg必装音频切片和格式转换都依赖它。Linux/macOS 用系统包管理器安装即可Windows 用户把ffmpeg.exe、ffprobe.exe放到项目根目录也行安装与启动Windows 整合包安装步骤Windows 用户走整合包路线下载并解压RVC-beta.7z整合包双击go-web.bat几秒后浏览器自动打开 Gradio 界面你会看到左侧排着 UVR5、预处理、训练、推理等选项卡。开发者若坚持源码安装先装 PyTorch再按显卡选对应依赖清单Nvidia 用 requirements.txtAMD/Intel 用 requirements-dml.txt装完后的启动方式与下文一致。Linux 源码安装与启动命令克隆仓库后装好 PyTorch 和与显卡匹配的依赖文件Nvidia 用 requirements.txtAMD ROCm 用 requirements-amd.txtIntel IPEX 用 requirements-ipex.txt 并多加载一行 oneapi 环境变量然后python infer-web.py终端会打印本地端口地址浏览器打开它界面即就绪。macOS 单脚本安装与启动sh ./run.sh这条命令会自动创建 Python 3.8 虚拟环境、装依赖、下载模型文件最后直接拉起界面你只需等待进度跑完。各平台启动前建议先确认模型文件齐全运行一次python tools/download_models.py完成第一次变声️ 从数据到出声音共三步每步都有明确的停止标志。第一步准备训练数据把 10-50 分钟最少 5 分钟的单人录音整理成 WAV44.1kHz 单声道最理想底噪尽量低。如果素材是歌曲先用 UVR5 选项卡把 Vocals 分离出来你会得到一段只剩人声的干净音频。把所有音频放进同一个文件夹。第二步预处理与训练在预处理选项卡填入模型名和音频目录路径点击开始自动切片和音高提取会依次完成。再到训练选项卡选模型版本 v2、采样率 48k其余参数保持默认即可total_epoch 默认 1000batch_size 44G 显存可降为 2learning_rate 0.0001。训练结束时你会看到进度条停在最后一轮assets/weights/目录里多出一个 .pth 检查点文件。第三步推理出声音先点一次训练索引生成索引再切到推理选项卡选中刚训好的模型上传一段录音点击推理扬声器里出来的就是转换结果音色变成了目标人物语气和情绪仍是你自己的。常见翻车点显存不足怎么办现象训练中途报 CUDA out of memory进程直接退出。原因训练需要 4G 及以上显存小显存显卡搭配过大的 batch_size 容易触顶。怎么办把 batch_size 降到 2 或 1并关掉其他占用显存的程序仍不够就只使用推理选项卡或借云显卡训练。训练完成但索引没生成现象训练结束后输出目录里没有 .index 文件推理选项卡的索引下拉框是空的。原因训练集过大导致索引构建时内存溢出或者漏点了生成按钮。怎么办在训练选项卡手动点击训练索引重新生成仍失败就减少训练集中的音频数量。路径含特殊字符导致 FFmpeg 报错现象启动或预处理时弹 FFmpeg 错误 / UTF-8 解码错误日志里能看到乱码路径。原因文件路径中的空格、括号或中文字符干扰了 FFmpeg 的命令行解析。怎么办把项目和音频都移到纯英文、无空格的路径例如D:/rvc/再重试。进阶入口实时变声运行gui_v1.pyWindows 下双击 go-realtime-gui.bat麦克风输入、转换、播放的闭环延迟 170ms适合直播和游戏。API 调用程序化接入参考 api_240604.py支持传入语音地址和参数返回转换后的音频。批量推理整个目录批量转换用 tools/infer_batch_rvc.py。更多资料疑难问题查 FAQ docs/cn/faq.md调参技巧看训练指南 docs/en/training_tips_en.md新功能关注更新日志。动手清单装好 FFmpeg跑一次模型下载脚本补齐 assets 目录启动界面Windows 双击 go-web.bat其他系统用上述启动命令在 WebUI 里预处理 10 分钟语音训练 1000 轮并生成索引到推理选项卡完成第一次 AI 变声听效果遇到问题先查 FAQ再对照本文排查路径与显存设置【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考