VoxCPM2:30 种语言的多语言语音合成与 48kHz 开源声音克隆,从首跑到生产部署

发布时间:2026/9/1 11:06:04
VoxCPM2:30 种语言的多语言语音合成与 48kHz 开源声音克隆,从首跑到生产部署 VoxCPM230 种语言的多语言语音合成与 48kHz 开源声音克隆从首跑到生产部署【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM2 是一个完全开源的多语言语音合成系统Apache-2.0 协议可免费商用。2B 参数、原生输出 48kHz 音频支持 30 种语言和 9 种中文方言还能从几秒参考音频克隆音色——不需要语言标签也不依赖离散音频编码。 能力速览10 秒看懂它能做什么能力项规格多语言语音合成30 种语言 9 种中文方言粤语、川话、吴语等直接输入文本即可音质48kHz 录音棚级输出接受 16kHz 参考音频内置超分推理速度RTX 4090 上 RTF 约 0.3Nano-vLLM 加速后约 0.13克隆方式音色设计无需参考音频/ 可控克隆 / 极致克隆音频续写授权Apache-2.0代码与权重均开源除了基础 TTS它还能根据自然语言描述捏一个全新音色Voice Design或在克隆时按指令调节语速、情绪——这两项是 1.5 版本没有的新能力。️ 无分词器的 48kHz 语音合成架构到底在做什么传统 TTS 普遍走离散化路线先把音频压成一串 token语言模型预测 token再解码回声音每一步都有信息损失。VoxCPM2 的做法更接近画家直接作画全程在连续表征空间里工作跳过离散编码环节因此韵律和细节损失更小。整条流水线是四阶段LocEnc → TSLM → RALM → LocDiT。LocEnc局部编码器负责处理参考音频和提示音频提取音色特征TSLM文本语义语言模型基于 MiniCPM-4 基座理解文本并产出语义表示RALM残差声学语言模型通过 FSQ 与 LocDiT 生成连续的语音潜变量最后的 AudioVAE V2 用非对称编解码把潜变量还原成 48kHz 波形所以喂 16kHz 的参考音频也能直出高采样率音频不需要外挂超分模型。 5 分钟跑通第一句合成环境要求Python 3.10–3.12、PyTorch ≥ 2.5.0GPU 需约 8GB 显存。安装只需一条命令pip install voxcpm然后加载模型、生成、落盘完整流程如下模型权重会自动下载from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( textVoxCPM2 让多语言语音合成变得简单高效。, cfg_value2.0, inference_timesteps10, seed42, ) sf.write(demo.wav, wav, model.tts_model.sample_rate)想跳过代码直接试听仓库自带 Gradio 界面python app.py --port 8808浏览器打开对应端口即可--device参数支持 cpu / mps / cuda 切换。 用一句描述设计一个全新音色当你手上没有任何参考音频——比如给新产品定一个品牌声音——用 Voice Design把音色描述用括号放在文本开头即可描述性别、年龄、情绪、语速都有效wav model.generate( text(年轻女性温柔甜美声音)欢迎使用 VoxCPM2, cfg_value2.0, inference_timesteps10, seed42, ) sf.write(voice_design.wav, wav, model.tts_model.sample_rate)官方在 InstructTTSEval 上的测试里VoxCPM2 的英文 APS/DSD/RP 三项指标84.2 / 83.2 / 71.4与最强开源方案持平或领先说明描述出什么声就是什么声这件事已经比较可靠。️ 从一段 3 秒录音克隆音色并控制语速情绪克隆分两档。可控克隆只传参考音频音色被保留的同时还能用括号指令调节风格适合用对方的声音但换一种播法的配音场景极致克隆额外提供参考音频的转录文本模型从参考音频直接续写音色、节奏、情绪全部还原适合要求必须和原声一模一样的高保真场景wav model.generate( text这是极致克隆功能的演示。, prompt_wav_pathpath/to/voice.wav, prompt_text参考音频的转录文本。, reference_wav_pathpath/to/voice.wav, ) sf.write(hifi_clone.wav, wav, model.tts_model.sample_rate)CLI 用户可以直接voxcpm clone --text ... --reference-audio voice.wav --output out.wav长文本批量任务用voxcpm batch一次跑完。 Seed-TTS-eval 基准成绩与版本演进零样本克隆基准 Seed-TTS-eval 上VoxCPM22B与几个主流模型的关键数字模型参数量英语 WER↓%中文 CER↓%英语 SIM↑%VoxCPM22B1.840.9775.3Qwen3-TTS1.7B1.231.2271.7FishAudio S24B0.990.54-CosyVoice31.5B2.221.1272.0可读性方面30 种语言内部 ASR 基准的平均错误率约 1.68%多语相似度测试里中文 82.5、英语 85.4、日语 82.8、韩语 83.3多数语言处于第一梯队。版本上它不是一步到位的孤品0.5B 和 1.5 版本沿用同一套无分词器范式下图为早期版本架构V2 换用 MiniCPM-4 基座输出从 44.1kHz 提到 48kHz语言覆盖从 2 种扩到 30 种并新增音色设计与可控克隆。版本参数采样率语言显存 (RTX 4090)VoxCPM22B48kHz30 种 9 方言~8GBVoxCPM1.50.6B44.1kHz2 种~6GBVoxCPM-0.5B0.5B16kHz2 种~5GB显存吃紧时回落到 1.5 或 0.5B 是个现实的取舍中英效果差距不大但 48kHz 和 30 语言只有 V2 有。上手之后的路微调、部署与插件LoRA 微调5–10 分钟音频即可适配特定说话人或领域python scripts/train_voxcpm_finetune.py --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml配置见 conf/voxcpm_v2/。Web 训练界面python lora_ft_webui.py打开 7860 端口训练与推理都在浏览器里完成。高吞吐服务pip install nano-vllm-voxcpm拿到约 0.13 的 RTF 和并发请求支持vLLM-Omni 则提供 OpenAI 兼容的/v1/audio/speech端点适合多租户生产环境。端侧与插件社区有 GGUFCPU/CUDA/Vulkan、ONNX、Apple Neural Engine 后端以及 ComfyUI 工作流不需要 Python 环境也能跑。 部署与调参的常见卡点CUDA out of memory→ VoxCPM2 需约 8GB 显存加load_denoiserFalse、降低并发批次或换 0.5B/1.5 版本。合成声音有杂音、断句生硬→ 把inference_timesteps从 10 提到 20cfg_value在 2.0–3.0 间微调并换一段更干净的参考音频。音色设计/可控克隆每次结果不同→ 官方明确说明这类生成在多次运行间存在波动同一 seed 多生成 1–3 次挑选即可这是当前的已知限制而非配置错误。从第一句generate()到 LoRA 微调和并发服务完整参数参考与数据格式示例都在 README_zh.md 里想深入架构细节可以顺着 src/voxcpm/ 的模块结构往下读。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考