edge-tts:免费调用微软在线文本转语音,一条命令产出 mp3 与 SRT 字幕

发布时间:2026/9/14 22:21:42
edge-tts:免费调用微软在线文本转语音,一条命令产出 mp3 与 SRT 字幕 edge-tts免费调用微软在线文本转语音一条命令产出 mp3 与 SRT 字幕【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-ttsedge-tts 是一个 Python 库用来调用微软 Edge 浏览器背后的在线文本转语音TTS服务。它不需要 API 密钥、不需要 Windows、不需要安装 Edgepip 装完就能把文本合成 mp3 音频并同时产出带时间轴的 SRT 字幕。调用直接打到微软的在线接口使用者零费用。三个现成场景有声书与朗读把长文本喂进去得到 mp3 和逐句对齐的字幕可直接给读屏软件或视频挂字幕。视频配音语音列表覆盖中、英、法、阿拉伯语等数十种语言每种语言有多个男女声按语言批量生成配音片段。智能家居与应用集成官方 README 里列了 Home Assistant 的 hass-edge-tts 插件作为集成案例说明它适合挂进长期运行的服务里。安装并生成第一条语音pip install edge-tts一行命令生成音频和字幕edge-tts --text 你好世界 --write-media hello.mp3 --write-subtitles hello.srt只想要命令行版本的话用pipx install edge-tts更合适不会污染系统 Python 环境。不指定--voice时默认使用en-US-EmmaMultilingualNeural。动手前先看看有哪些可选声音edge-tts --list-voices输出是四列表格名称、性别、适用内容类别、声音性格。挑一个名字传给--voice即可。用三个参数微调语速、音量、音调--rate、--volume、--pitch分别对应语速、音量、音调单位是百分比和赫兹。负值要紧跟等号写否则 shell 会把-50%当成另一个参数edge-tts --rate-50% --volume20% --pitch-50Hz --text 演示 --write-media demo.mp3输入端除了--text还有--file从文件读文本-表示从标准输入--proxy可给语音列表和合成请求走代理。自定义 SSML 已被移除服务端只接受 Edge 浏览器自己生成的 SSML而 prosody 里能调的项都被上面三个参数覆盖了不需要绕路。字幕与实时播放SRT 来自合成过程中服务回传的 WordBoundary / SentenceBoundary 边界事件由 SubMaker 拼成字幕行时间戳按实际收到的音频字节数校准长文本不会逐渐漂移。另一个edge-playback命令直接调用本地播放器出声不落盘。注意它在非 Windows 平台要先装 mpv且不支持--write-media、--write-subtitles、--list-voices这三个选项。Python 代码里几行就够把文本转语音接进代码同步写法只要两行完整用法见 examples/ 里的六个官方示例communicate edge_tts.Communicate(text, zh-CN-XiaoxiaoNeural) communicate.save_sync(out.mp3)异步环境改用await communicate.save(...)要在代码里出自幕把边界事件喂给edge_tts.SubMaker()后调get_srt()即可。想按属性动态选声音VoicesManager 可以按语言、性别、区域筛选voices await VoicesManager.create()拿到后再用voices.find(GenderFemale, Localezh-CN)筛出候选语音。⚠️ 几个容易踩的细节依赖在线服务合成走微软在线接口网络不稳时建议在代码里加重试连接超时和读超时在Communicate构造函数里可配默认 10 秒和 60 秒。长文本自动分段超长输入内部按 4096 字节自动切块优先在句界、词界处断并避开多字节字符和 XML 实体中间不需要自己分段。403 会自动恢复服务端用一个由浏览器版本和本地时间生成的 token 校验请求失效时 drm.py 会纠正时钟偏移后自动重连。音频规格固定输出是 24kHz、48kbps 的单声道 mp3做朗读绰绰有余别把它当音乐级音源用。源码结构一个 WebSocket 客户端加几个小工具核心逻辑是 communicate.py 里的 WebSocket 客户端连上合成接口、发送 SSML、流式收音频与边界事件其余文件都是围绕它的小工具。edge-tts/ ├── examples/ # 六个官方示例同步/异步、流式、字幕、动态选声 ├── src/edge_tts/ │ ├── communicate.py # 核心WebSocket 通信、长文分段、音频与边界事件解析 │ ├── voices.py # 拉取语音列表按语言/性别筛选 │ ├── submaker.py # 边界事件转 SRT 字幕 │ └── drm.py # 请求 token 生成与时钟偏移纠正 ├── src/edge_playback/ # edge-playback 命令调本地播放器实时出声 └── tests/ # 长文本回归测试脚本先装好跑一遍第一条命令听听 hello.mp3想深入就读communicate.py的stream()方法。源码可用git clone https://gitcode.com/GitHub_Trending/ed/edge-tts获取。【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询