faster-whisper 语音转文字指南:CTranslate2 推理引擎带来 4 倍提速

发布时间:2026/9/5 23:29:04
faster-whisper 语音转文字指南:CTranslate2 推理引擎带来 4 倍提速 faster-whisper 语音转文字指南CTranslate2 推理引擎带来 4 倍提速【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper如果你的团队还在逐条转写会议录音值得先看看 faster-whisper。它是基于 CTranslate2 推理引擎重写的 OpenAI Whisper。识别准确率不变速度最多快 4 倍占用的内存更少。这篇文章从真实场景出发带你走完选型、提速和排坑的完整路径。先想想哪些活适合交给它三类任务最值得做把一个月的会议录音批量转成可检索的文字给视频补带时间戳的字幕在本机离线转录音频不用出内网它是一个 Python 包不需要单独装 FFmpeg音频解码由内置的 PyAV 完成只需 Python 3.9 以上。一条命令就能装好pip install faster-whisper装好后直接转录十几行以内就能出结果from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) print(info.language, [s.text for s in segments])这一节的结论一条命令起步上面三个场景都能直接套用。选对模型尺寸与计算类型模型尺寸决定速度和精度的平衡tiny 最快适合实时草稿small 通用均衡medium 偏专业large-v3 精度最高。官方基准用 13 分钟音频做了对比。GPU 上跑 large-v2fp16 用时 1 分 03 秒显存约 4.5GB换成 int8 量化只要 59 秒显存降到 2.9GB。也就是说量化后速度不降内存大约省掉三分之一。# GPU 上用 float16 WhisperModel(large-v3, devicecuda, compute_typefloat16) # 纯 CPU 机器用 int8 WhisperModel(small, devicecpu, compute_typeint8)这一节的结论精度优先选 large-v3机器紧张就 small 加 int8。长音频跑满 GPU用批量推理默认的model.transcribe一次处理一个片段GPU 常有空转。长音频可以改用BatchedInferencePipeline把多个片段并行喂进去参数直接传batch_size。效果对比同一份 13 分钟音频GPU 上batch_size8时 17 秒完成是单条流水的 4 倍速代价是显存升到 6GB 左右。CPU 上batch_size8也能把 small 模型从 2 分 37 秒压到 1 分 06 秒int8 量化下是 51 秒。这一节的结论长音频、多文件场景先想批量模式显存不够再降batch_size。⚠️ 容易踩的三个坑transcribe返回的是生成器遍历它才真正开始转录。忘了list(segments)你会以为秒出结果其实一行都没跑。新版 ctranslate2 只支持 CUDA 12 加 cuDNN 9。你的环境是 CUDA 11就锁版本pip install ctranslate23.24.0否则 GPU 起不来。vad_filterTrue默认很保守只过滤超过 2 秒的静音。想更激进地删静音传vad_parametersdict(min_silence_duration_ms500)。更完整的参数说明在 faster_whisper/transcribe.py 里每个参数都有注释。这一节的结论多数转不出来或比想象中慢的问题根源都在这三处。✅ 行动清单先跑pip install faster-whisper用 small 加 int8 转一段真实音频上 GPU 换 large-v3 加 float16对比一次准确率差异长音频加BatchedInferencePipeline记录一下显存峰值术语识别不准时用initial_prompt或hotwords注入领域词汇要容器化部署参考 docker/Dockerfile 的环境配置【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考