GPT-SoVITS版本大揭秘:v1/v2/v3/v4/v2Pro六大版本差异与选型终极指南

发布时间:2026/9/3 12:29:43
GPT-SoVITS版本大揭秘:v1/v2/v3/v4/v2Pro六大版本差异与选型终极指南 GPT-SoVITS版本大揭秘v1/v2/v3/v4/v2Pro六大版本差异与选型终极指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS是一款强大的开源少样本语音合成TTS与声音克隆工具仅需 1 分钟人声数据就能训练出高相似度的专属语音模型。随着项目迭代它先后推出了v1、v2、v3、v4、v2Pro、v2ProPlus六大版本新手常常面对到底该用哪个版本的困惑。本文用一张时间线 一张对比表带你快速搞懂每个版本的差异并给出一步到位的选型建议。一、版本进化时间线一图看懂 GPT-SoVITS 迭代史版本发布时间关键词v12024 年初开山之作2k 小时预训练v22024.08.21多语种、5k 小时预训练、文本前端升级v32025.02.28相似度飞跃、情感更丰富、LoRA 训练v42025.04.22修复金属音、原生 48kHzv2Pro / v2ProPlus2025.06性能超 v4成本回到 v2 水平完整的版本演进记录可查阅项目官方更新日志docs/en/Changelog_EN.md 与中文文档 docs/cn/README.md。二、六大版本逐个拆解1️⃣ v1开山之作轻量入门v1 是 GPT-SoVITS 的初代版本预训练语料约 2k 小时支持中、英、日三语混合合成。它的优点是对硬件要求最低老显卡、低显存机器也能跑适合先体验1 分钟数据克隆声音的新手。⚠️ v1 属于历史版本不再有新特性投入新项目不建议首选。2️⃣ v2多语种 文本前端大升级v2 相比 v1 的核心提升来自官方 V2 更新说明新增韩语、粤语支持v1 仅中/英/日预训练语料从 2k 小时扩展到5k 小时音质更稳全新文本前端多音字、中英混读更准确对低质量参考音频的合成效果明显改善v2 是社区生态最成熟的版本绝大多数第三方教程、模型分享都基于它硬件成本不高。3️⃣ v3相似度飞跃但吃显存v3 是一次架构级升级带来三个显著变化音色相似度更高少样本甚至零样本不训练直接推效果都显著提升GPT 更稳定重复、漏字问题更少更容易合成带情绪的表达新增LoRA 训练微调显存需求降至约 8GB全量微调约 14GB开梯度检查点可压到 12GB代价是v3 原生输出 24kHz 音频部分用户会觉得闷项目内置了 24k→48k 音频超分功能缓解见 tools/audio_sr.py且对训练集音频质量要求更高音色更偏向参考音频而非整个训练集。4️⃣ v4v3 的完全修复版v4 针对 v3 的两个痛点做了定向修复修复了非整数倍上采样导致的金属音问题原生输出 48kHz 音频彻底解决声音闷糊作者明确表示 v4 是 v3 的直接替代。如果你已经用了 v3升级 v4 基本无脑。5️⃣ v2Pro / v2ProPlus性价比之王当前推荐2025 年 6 月发布的 v2Pro 系列是目前的六边形战士性能超过 v4但保留 v2 的硬件成本与推理速度v2ProPlus 推理速度RTF实测4060Ti 约 0.028、4090 约 0.0141400 词约 4 分钟音频仅需 3.36 秒与 v1/v2 同族特性对平均音质一般的训练集更友好音色贴合整个训练集而非仅参考音频v2Pro 系列还支持流式推理见 GPT_SoVITS/stream_v2pro.py三、六大版本核心差异一览表维度v1v2v3v4v2Pro / Plus支持语种中/英/日韩/粤同 v2同 v2同 v2预训练语料2k 小时5k 小时更大规模同 v3同 v3输出采样率32kHz32kHz24kHz可超分48kHz32kHz显存要求低低高LoRA 8GB 起高中等音色风格训练集训练集偏参考音频偏参考音频训练集低质量训练集✅ 尚可✅ 较好❌ 不推荐❌ 不推荐✅ 较好生态/教程丰富度多最多多中快速积累中 一个容易忽略的细节各版本训练产物存放在不同目录SoVITS_weights/SoVITS_weights_v2/_v3/_v4/_v2Pro/_v2ProPlus模型互不干扰可在同一环境切换使用。目录映射逻辑见 config.py。四、新手选型建议一步选对版本按你的场景对号入座即可纯新手、低配显卡、先跑通流程→ 选v2生态最全、显存最省、教程最多追求最佳音质、显卡 ≥12GB→ 选v4音质上限高、无金属音、48kHz 原生输出训练音频质量一般手机录音、有底噪→ 选v2 或 v2Prov3/v4 在平均音质较低的语料上效果反而不好追求速度 高音质直播、实时 TTS 场景→ 选v2ProPlusRTF 极低还带流式推理已有 v3 存量项目→ 直接升级到v4属于无损替换五、版本切换与模型管理实操启动主 WebUI 并指定 v1python webui.py v1不带参数则进入当前版本v2 及以上入口文件为 webui.py集成包用户可双击go-webui-v1.bat切换。推理 WebUI中可手动切换模型版本各版本的预训练权重路径如 v2Pro 的s2Gv2Pro.pth、v4 的s2Gv4.pth统一注册在 GPT_SoVITS/TTS_infer_pack/TTS.py 的默认配置里推理参数模板位于 GPT_SoVITS/configs/tts_infer.yaml。各版本训练入口彼此独立v1/v2 用 GPT_SoVITS/s2_train.pyv3/v4 用 GPT_SoVITS/s2_train_v3.pyv3 的 LoRA 训练见 GPT_SoVITS/s2_train_v3_lora.py。部署到服务端时v3/v4 可导出为 TorchScript 加速脚本位于 GPT_SoVITS/export_torch_script_v3v4.py。六、常见问题 FAQQ1v2 训练的模型能在 v4 上推理吗不能。GPT/SoVITS 权重按版本分目录管理跨版本模型不通用切换版本需重新训练底模预训练权重复用即可。Q2为什么 v3 听起来比 v4闷v3 原生 24kHz高频信息有损失v4 改用整数倍上采样并原生输出 48kHz同时消除了金属音。Q3显存只有 8GB能用 v3 吗可以走LoRA 微调路线v3 官方支持 8GB 显存完成 LoRA 训练这是 v3 系列对低显存用户最友好的入口。Q4如何确认我下载的是哪个版本的预训练权重查看GPT_SoVITS/pretrained_models/目录s2G488k.pth对应 v1gsv-v2final-pretrained/对应 v2s2Gv3.pth对应 v3gsv-v4-pretrained/对应 v4v2Pro/对应 v2Pro 系列。一句话总结低配先跑 v2高配直接 v4追求性价比与速度选 v2ProPlus——搞懂这三句GPT-SoVITS 的版本选择就不再是难题。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考