4倍速的语音转文字:faster-whisper 上手教程

发布时间:2026/9/5 16:19:32
4倍速的语音转文字:faster-whisper 上手教程 4倍速的语音转文字faster-whisper 上手教程【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper13 分钟会议录音原版 Whisper 在 GPU 上要 2 分 23 秒faster-whisper 是 1 分 03 秒开启 int8 量化后只要 59 秒。faster-whisper 是基于 CTranslate2 引擎重新实现的 OpenAI Whisper核心功能就一件事把语音转文字做得更快、占内存更少。一、它凭什么值得关注能力速览速度优势最直观。官方在 RTX 3070 Ti 上用 large-v2 模型测了 13 分钟音频原版 Whisper 2 分 23 秒faster-whisperfloat161 分 03 秒int8 量化 59 秒准确率相同。内存省掉近一半。int8 量化有点像图片改存 JPEG肉眼看不出差别体积却小得多。GPU 上显存从 4708MB 降到 2926MBCPU 上 small 模型 int8 只要 1477MB。接入门槛低。不用装 FFmpegPyAV 库自带解码依赖一条 pip 命令装完。二、从零到跑通最短路经前置条件只有 Python 3.9不需要单独安装 FFmpeg必须执行的只有安装这一步pip install faster-whisper第一次运行时模型会自动下载并缓存之后离线也能跑。先用 CPU small 模型 int8 把链路跑通这是 CPU 上最省内存的组合from faster_whisper import WhisperModel # int8内存减半且精度损失很小CPU 首选 model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})有一个细节segments是生成器真正开始转录是在你迭代它的那一刻。想提前跑完就list(segments)包一层。三、实战一次完整调用有 GPU 的话先装 faster-whisper GPU 加速需要的两个 NVIDIA 依赖要求 CUDA 12 cuDNN 9Linux 上运行前还需设置LD_LIBRARY_PATH指向库pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*再发起调用from faster_whisper import WhisperModel # float16 是 GPU 默认精度显存紧张时换 int8_float16 model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(info.language, info.language_probability) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})跑起来后第一行是检测到的语言与置信度不传language时会用音频前 30 秒自动判断之后每行一个段落start/end是秒级时间范围text就是转录结果。device与compute_type的组合速查运行环境devicecompute_type定位GPUcudafloat16全精度速度最佳显存吃紧的 GPUcudaint8_float16混合精度省显存CPUcpuint8内存占用低四、进阶解锁更多能力词级时间戳场景做字幕、文字和视频逐字对齐段落级时间不够细。怎么开给transcribe加word_timestampsTrue然后遍历segment.words就能拿到每个词的开始与结束时间。注意该特性默认关闭只在需要精确到词时开避免多一层遍历。VAD 静音过滤场景访谈、会议这类长录音里静默很多转录会浪费在无声段上。怎么开这个能力默认就是打开的且默认保守只去掉超过 2 秒的静音想过滤更激进传vad_parametersdict(min_silence_duration_ms500)。注意阈值调得越低越容易切断句间停顿全部参数可看 vad.py。批量推理场景一次要处理多条长音频单文件转录时 GPU 利用率吃不满。怎么开用BatchedInferencePipeline(modelmodel)包一层转录时传batch_size16之类的值。注意官方基准里同一段 13 分钟音频GPU 上单文件 1 分 03 秒batch_size8 时 17 秒批量模式下 VAD 默认开启。五、选型与调优决策如果你只有 CPU直接选 int8 量化small 模型 13 分钟音频 1 分 42 秒而原版 Whisper fp32 要 6 分 58 秒内存分别是 1477MB 对 2335MB。如果你有一块 8GB 级的主流 GPU先用 float16显存不够再切 int8_float16以 large-v2 为例显存从 4525MB 降到 2926MB精度代价很小。如果你要的是最高准确率选 large-v3纯英文内容可以试 distil-large-v3官方基准里比 transformers 实现快约 44%46 分 12 秒对 25 分 50 秒词错率还更低。语音转文字的瓶颈往往在推理引擎而不是模型换掉引擎同样的 13 分钟录音就能从 2 分 23 秒压到 59 秒。下一步建议找一段真实录音先用 small int8 跑通感觉速度够用之前不必急着上 large-v3 或批量推理。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考