离线转录完全指南:Buzz 三步搞定本地语音转文字

发布时间:2026/9/6 16:13:34
离线转录完全指南:Buzz 三步搞定本地语音转文字 离线转录完全指南Buzz 三步搞定本地语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个离线转录工具把会议录音和播客文件在本地电脑直接转成文字。如果你需要不上传云端就能把音频转文字这篇文章适合你读完就能独立跑通从安装到导出字幕的完整流程。快速上手——从克隆到跑通Buzz 依赖ffmpeg解码音频先装好它Linux 用sudo apt install ffmpeg。然后按两步走获取代码并安装依赖。克隆仓库后创建 Python 3.12 虚拟环境并安装 Buzzgit clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz python3.12 -m venv .venv .venv/bin/pip install -e .启动验证。运行入口脚本界面正常加载就说明环境就绪.venv/bin/python main.py核心任务实操做会议录音转文字时如何选对模型档位Buzz 模型选择场景周会录音要当天出文字稿。关键操作按CtrlO选择音频文件。在弹出窗口选择任务类型转录或翻译成英文并手动指定语言别依赖自动检测。选择模型类型和档位点击Run加入队列。状态变为Completed后双击该行打开转录结果。决策提示常用档位对照档位适合场景tiny快速试读速度最快small日常会议录音medium重要内容速度与精度均衡large精度最高耗时最长 不确定时先用small试转一条看结果再定档位。验证方法打开结果通读一遍语句通顺、人名没串字就算达标要字幕就把导出格式换成 SRT。做批量播客归档时队列配置一次到位Buzz 批量转录设置场景一个季度的播客要一次性归档。关键操作按CtrlO多选文件一次性全部加入队列。勾选Word-Level Timings生成逐字时间戳方便之后调字幕。在Export As里设置输出格式TXT、SRT、VTT 按需勾选。点击Run队列中的任务会依次跑完不用盯着界面。决策提示同一系列文件统一模型档位和语言避免不同文件转录风格不一致。验证方法打开输出目录确认每个音频都有同名输出文件缺哪个补哪个。编辑转录文本时如何把字幕调得贴合音频场景字幕行太长需要重新切分和微调。关键操作双击已完成的任务打开转录编辑器。用底部播放条定位时间点直接修改文字改动自动保存。点击Resize按钮设置每行最大字数建议 40~50 字开启按标点拆分。点击Merge应用调整再导出 SRT。决策提示带逐字时间戳的文件才能按标点拆分字幕没开的只能按最大长度重新合并。验证方法播放音频同时看字幕逐行确认出现和消失时机与语音一致。调优与进阶效果不满意时三条调参规则如果音频清晰但输出忽高忽低把温度调低0.2~0.4模型会转写得更保守。如果专有名词或术语总被认错在添加任务时点开Advanced把词写进Initial prompt作为提示。如果语言拿不准也建议明确指定自动检测只看开头几秒短音频容易误判。全局转录设置可以在Help→Preferences里查看想更快时启用 GPU 加速⚡ 这一步只对 NVIDIA 显卡有意义Buzz 的本地语音转文字靠的就是把算力甩给 GPU。先运行下面的命令确认显卡和驱动可用nvidia-smi添加任务时把模型类型换成Faster Whisper需 6GB 以上显存不是 N 卡就选Whisper.cpp它支持多数 GPU 甚至纯 CPU。用两种类型各转同一段音频对比速度和准确率再定。验证方法转录运行时任务管理器里 GPU 占用应明显抬升。踩坑速查启动时提示No module named buzz现象运行python main.py报导入错误。原因没进虚拟环境或者依赖没装完。解决1先执行.venv/bin/activate激活环境Windows 用\.venv\Scripts\activate。2重跑pip install -e .。3再次启动。模型下载失败或下载后程序闪退现象模型列表里没有目标模型或点用它时直接崩溃。原因模型文件下载不完整或损坏。解决1到Help→Preferences→Models删除问题模型。2重新下载。3离线转录场景可以把别的机器上的模型目录Linux 为~/.cache/Buzz/models复制到本机相同位置。转录太慢或系统负载高现象队列卡住进度条几乎不动。原因模型档位太大或用的是默认 Whisper 实现。解决1换更小的档位tiny/base或Whisper.cpp类型。2关掉其他吃 CPU/GPU 的应用。3有 N 卡就改用Faster Whisper走 GPU。模型选档决定速度和精度的平衡队列加逐字时间戳是批量出字幕的前提编辑与 Resize 工具随时能补救时间戳。参数细节和更多场景可以看 官方文档。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考