OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的

发布时间:2026/9/1 14:27:45
OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的 OpenVoice 语音克隆教程3 步把 AI 的声音换成你自己的【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice先说结果你只需要一段十几秒的录音OpenVoice 就能把任意 TTS 的声音偷换成你的音色——说话人还是那个人听感却已经变成你本人。它是 MIT 与 MyShell 开源的即时语音克隆Instant Voice Cloning音频基础模型无需训练、无需 GPU参考音频支持任意语言克隆出的声音还能跨语言输出。MIT 许可证商用免费。下面按能干什么 → 怎么搭环境 → 三步出效果 → 原理速览 → 效果不好的排查的顺序讲全程不需要你懂深度学习。它能帮你做什么一句话换音色不改内容不改语言。音色克隆给一段干净的人声OpenVoice 提取其音调颜色tone color生成音频听起来就是这个人。风格可控口音、情绪、节奏、停顿、语调由底层 TTS 说话人模型决定你可以按需切换而不是被参考音频锁死。跨语言克隆参考音频说中文生成日语、英语、法语都可以V2 原生支持英、西、法、中、日、韩六种语言。V2 音质更好相比 V1V2 换了一套训练策略输出更自然。典型用途给自己做专属语音助手、给小说/播客配自己的声音、给视频换配音、测试 TTS 产品的音色方案。环境准备只有两条命令本地跑需要 Linux 环境、Python 3.9 和 PyTorch 基础依赖清单见 requirements.txt。git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .之后把对应版本的 checkpoint 下载到checkpointsV1或checkpoints_v2V2目录具体下载地址在 docs/USAGE.md 的 Linux Install 一节里。装完可以直接打开根目录下的demo_part1.ipynb风格控制、demo_part2.ipynb跨语言克隆、demo_part3.ipynbV2 用法三个示例 Notebook 验证环境也可以跑python -m openvoice_app --share起一个本地 Gradio 界面。三步出效果用 Workshop 克隆你的声音不用写代码的体验路径是 Workshop 界面三步走Step 1进入 Workshop 创建一个 Bot。这是承载你克隆声音的容器创建后进入它的 Setting 页。Step 2从 Widget Center 挑一个 TTS 模型。在 Widget Center 按语言筛选TTS → English / Chinese / Japanese…每个卡片点一下就能试听。记住这个模型——它决定输出音频的口音和情绪克隆的只是音色。Step 3上传参考音频点击 Create 生成你的克隆声音。在 Voice (TTS) 设置区点 Create选通过语音克隆创建上传一段你自己的录音即可。建议单人口播、无背景音乐、无长时间静默、时长 10 秒以上效果会明显更好参考素材可直接用仓库里的resources/example_reference.mp3。幕后原理60 秒速览拆开看就是一条流水线文本 风格参数口音、情绪、语调先送进基础说话人 TTS 模型产出一段替身声音**Tone color extractor音调提取器**同时分析你的参考音频抽出纯音色特征替身声音经 Encoder / Flow 分解后把音色维度替换成参考人的其余风格特征原样保留经 Flow⁻¹ / Decoder 合成最终音频。关键就一句话它只换音色不换口音和情绪。所以生成语气不像不是 Bug——想让语气像就换一个语气相近的基础说话人模型或调整风格参数。效果不对时先查这五件事质量不达标 90% 出在参考音频上按顺序排查有背景噪音换成干净录音效果立竿见影。太短太短的音频提取不稳定10 秒起。多人说话必须单人音频。有大段静音长静默段会干扰提取剪掉。重名缓存换了同名的参考音频但没删processed目录程序会复用旧处理结果删掉重来。口音/情绪不像、语言支持、Silero 下载失败等问题仓库里的 docs/QA.md 有逐条解答想深入看跨语言用法直接跟demo_part2.ipynb走一遍。下一步建议先用 V2 的示例 Notebook 跑通一条音频听感对比再考虑是否要接自己的基础说话人模型做定制口音。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考