
10分钟跑通文字转语音ChatTTS-ui本地部署教程【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui把字幕文本转成配音、批量生成有声书素材时一个能本地部署的文字转语音服务比付费 API 更省心。ChatTTS-ui 把开源语音合成模型 ChatTTS 包成了一个网页输入文字、输出音频中文、英文和数字混排都能自然朗读同时对外提供一个 /tts 接口供程序调用。看完这篇你能在自己机器上部署好它并用代码直接调用合成语音。ChatTTS-ui 是什么本地文字转语音服务ChatTTS-ui 是一个 Flask 写的 Web 服务核心链路就三步接收网页提交的文本调用 ChatTTS 模型合成 24kHz 的 wav 音频再把播放器和下载链接返回给浏览器。它把三件事打包好了Web 界面输入文字、选音色、点按钮音频直接出不需要装任何客户端API 接口和网页走同一个 /tts 端点脚本或其他工具都能调也兼容 pyVideoTrans 这类软件直接接入内置 24 个固定音色预放在 speaker 目录里页面上直接下拉选择和商用 TTS API 的差别很直白不注册账号、不按字符计费、音频数据不出本机。和直接用 ChatTTS 库相比设备检测、模型下载、中英文分词这些细节都被处理掉了网页上只管看结果。本地部署步骤源码安装Windows 有开箱即用的打包版也提供 Docker 部署方式细节都在 README.md 里。这里展开源码部署Linux 和 macOS 都适用最灵活先准备 Python 3.9–3.11不支持 3.12 及以上和 git。克隆仓库并安装依赖mkdir -p /data/chattts cd /data/chattts git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui . python3 -m venv venv source ./venv/bin/activate pip3 install -r requirements.txt pip3 install torch2.7.1 torchaudio2.7.1有 4G 以上显存的英伟达显卡、想要 GPU 加速的话把最后一行换成 CUDA 版本pip3 install torch2.7.1 torchaudio2.7.1 --index-url https://download.pytorch.org/whl/cu128另外需要装好 CUDA 12.8 及以上版本的 Toolkit。显存不足 4G 时服务会强制走 CPU这一步可以跳过。第一次上手从启动到出音频执行启动命令。首次运行会自动下载模型优先从 ModelScope连不上则切换到 HuggingFace所以第一次启动会明显慢一些python3 app.py浏览器自动打开 http://127.0.0.1:9966页面上四步出结果在顶部文本框输入文字。文本按行合成一句一行排版最干净。下拉框选音色。下拉里是内置的固定音色编号不同编号对应不同声音。点击立即合成声音出现加载动画等待合成完成。完成后面板出现音频播放器并自动播放点下载音频把 wav 存到本地。页面还有两个按钮值得知道导入txt 可以直接把文本文件读进输入框适合长素材清理所有wav文件 会删掉已合成的音频磁盘紧张时用。核心功能音色怎么选、语气怎么控音色有三种拿法默认音色是数字比如 2222。首次用某个编号合成时程序以它为随机种子生成一个音色并缓存下来之后同一编号就是同一副嗓子。想要下拉框之外的音色有两条路把 csv 或 pt 格式的音色文件放进 speaker 目录重启后出现在下拉列表或者在音色值栏填任意大于 0 的数字跳过下拉框用这个数字当种子生成并缓存新音色。注意同一音色值在不同机器上音调可能略有差异建议在目标机器上挑定后固定使用。prompt 控制符ChatTTS 内置语气控制写法是方括号符号[laugh_0] 加笑声、[break_6] 插入停顿、[oral_2] 让语气更口语化。符号填在 Prompt 输入框或随 API 一起传听感比纯文本自然不少。如果文本本身带符号、或合成效果不理想勾选跳过refine text服务会跳过文本预润色环节直接进合成。语速与随机性语速是 1–9 的滑杆默认 5数值越大越快。temperature 默认 0.3调低更稳定调高音调起伏更明显但也会更飘。top_p、top_k 保持默认即可日常调参先动前两个。中英文混排文本会被自动分词处理中文和英文分开合成数字转成对应语言的读法中文语境下 123 读作一二三不用手动清洗文本。API 调用一行代码完成文字转语音网页和程序走的是同一个端点POST http://127.0.0.1:9966/tts必填参数只有 textvoice、prompt、custom_voice、temperature 按需传import requests res requests.post(http://127.0.0.1:9966/tts, data{ text: 大家好这是一个本地文字转语音合成示例。, voice: 2222, prompt: [laugh_0], temperature: 0.3 }) print(res.json())成功时 audio_files 里带 wav 的本地路径和可下载地址{code: 0, msg: ok, audio_files: [{filename: .../143012_use2.31s-seed2222.wav, url: http://127.0.0.1:9966/static/wavs/143012_use2.31s-seed2222.wav}]}失败返回 {code: 1, msg: 错误原因}。想直接拿音频文件而不是 JSON请求里加 wav1 参数响应体就是 wav 本身。全部参数见 README.md 的 API 章节。避坑与排错5个高频报错下载模型时报 proxy 相关错误→ 原因默认从 ModelScope 下载模型它只支持大陆直连开代理反而失败 → 解法关闭代理后重启网络够不到 ModelScope 时程序会自动切换 HuggingFace 下载启动报 Missing spk_stat.pt→ 原因ModelScope 模型库缺这个文件而按种子取音色时必须读它 → 解法从 HuggingFace 补下 spk_stat.pt放到 models/pzc163/chatTTS/asset 目录有显卡但服务走 CPU、合成很慢→ 原因装的 torch 是 CPU 版或显存低于 4G后者会强制 CPU → 解法装好 CUDA 12.8 后卸载旧 torch重装 cu128 版本再启动报 cannot find a working triton installation→ 原因当前环境装不了 triton而 .env 默认 compiletrue → 解法打开 .env把 compiletrue 改成 compilefalse报 Dynamo is not supported on Python 3.12→ 原因项目只支持 Python 3.9–3.11 → 解法换低版本 Python 重建虚拟环境依赖重装一遍ChatTTS-ui 把 ChatTTS 变成了网页和 API 两全的本地文字转语音服务全程免费、音频不出本机。更多部署方式看 README.md完整报错列表看 faq.md其他问题可以提项目 Issue。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考