Xinference 内置中文长音频识别模型 paraformer-zh-long 使用指南:FunASR 家族的 audio2text 实战

发布时间:2026/9/16 13:53:45
Xinference 内置中文长音频识别模型 paraformer-zh-long 使用指南:FunASR 家族的 audio2text 实战 Xinference 内置中文长音频识别模型 paraformer-zh-long 使用指南FunASR 家族的 audio2text 实战【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本文以 Xinference 内置音频模型paraformer-zh-long为核心讲解如何在当前开源推理服务中快速启动该模型、理解其默认模型配置VAD 语音活动检测 标点恢复并通过 OpenAI 兼容的/v1/audio/transcriptions接口完成中文长音频的语音转写。读完本文你将掌握从命令行启动、底层 FunASR 实现原理到 REST/OpenAI 客户端调用的完整链路可直接复用到会议转写、音视频字幕、客服录音分析等中文长音频场景。模型档案官方文档中的核心规格根据模型内置文档 paraformer-zh-long.rst该模型的官方规格如下属性值Model Nameparaformer-zh-longModel FamilyfunasrAbilities[audio2text]语音转文本MultilingualFalse面向中文场景Model IDJunHowie/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-pytorch从 Model ID 的命名可以解读出该模型的三个关键特征vad表示内置语音活动检测Voice Activity Detection组件可自动切分长音频中的语音段punc表示内置标点恢复Punctuation Restoration模型输出文本会自动补全标点16k与vocab8404表示面向 16kHz 采样率音频、词表大小为 8404 的中文普通话识别任务。-long后缀意味着它正是为长音频场景设计的 Paraformer-large 变体这也是它与同家族paraformer-zh的核心差异所在。快速启动一条命令拉起长音频 ASR原文档给出的启动命令是xinference launch --model-name paraformer-zh-long --model-type audio启动成功后Xinference 会为模型分配一个唯一标识model_uid默认与model_name一致后续所有推理请求都通过该标识路由到模型实例。结合底层实现 funasr.py 的FunASRModel.load()方法--model-type audio指向了音频模型注册表中的内置模型条目由 model_spec.json 定义启动时还会自动完成两件事模型权重拉取优先从 Hugging Face 拉取JunHowie/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-pytorch锁定 revisionb6d8cb81645e34056cd3dda41e5624a740587de3ModelScope 源iic/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-pytorch作为国内备选源两者完全等价。虚拟环境准备按virtualenv字段自动创建独立 Python 环境固定安装funasr1.2.7并复用系统侧的torch、torchaudio、numpy避免依赖版本互相污染。常用启动参数--model-uid uid自定义模型唯一标识方便在服务端统一管理多个模型实例。--device cpu|cuda显式指定推理设备若省略load()内部通过get_available_device()自动选择见 funasr.py且会先调用is_device_available()校验设备可用性设备不可用时直接抛出ValueError。默认模型配置VAD 标点 批处理窗口paraformer-zh-long的默认配置在 model_spec.json 中定义共两层启动与转写时分别生效模型级默认配置default_model_config{ vad_model: fsmn-vad, punc_model: ct-punc }vad_model: fsmn-vad使用 FSMN-VAD 语音活动检测模型。长音频先经 VAD 切分为语音活动段逐段送入 ASR避免一次性解码整段超长音频带来的精度与内存问题——这正是-long型号可以稳定处理长音频的机制基础。punc_model: ct-punc使用 CT-Transformer 标点模型对识别结果做标点恢复。这也是convert_to_openai_format输出中每个 segment 文本自带中文标点的原因。转写级默认配置default_transcription_config{ batch_size_s: 300 }batch_size_s: 300以秒为单位的批处理窗口大小即每 300 秒5 分钟音频作为一个 batch 送入模型解码。对超长音频该参数直接影响显存占用与推理吞吐可按音频长度和硬件条件调整。引擎归属与依赖音频引擎注册表 engine.py 将funasr家族的 STT 模型注册到PyTorch引擎PyTorchFunASRAudioModelrequired_libs (funasr,)底层通过 FunASR 官方AutoModel完成加载与推理。若环境缺少funasr启动时会抛出带安装指引的ImportError提示pip install funasr见 funasr.py。底层实现FunASRModel 的转写调用链paraformer-zh-long的运行时实现集中在 funasr.py 的FunASRModel类其核心调用链如下加载load()用AutoModel(modelself._model_path, deviceself._device, **kwargs)加载模型其中kwargs由default_model_config与启动参数合并而来。转写transcriptions()将收到的音频字节写入临时文件调用self._model.generate(inputf.name, cache{}, languagelanguage, **kw)随后用 FunASR 的rich_transcription_postprocess对原始文本做富文本后处理如去除口头禅、规整标点。输出按response_format返回 OpenAI 兼容结构见下节。接口能力边界重要限制实现层面对部分 OpenAI 音频参数明确不支持调用时需注意temperature ! 0直接抛RuntimeError(temperature is not supported for FunASR)——FunASR 解码是确定性的不接受采样温度。timestamp_granularities同样抛RuntimeError不区分word/segment粒度。prompt仅打印warning并忽略不会参与热词引导。translations()FunASR 不支持翻译 API调用即抛RuntimeError见 funasr.py。language默认自动置为auto由模型内部进行语种判定funasr.py。调用方式REST 与 OpenAI 兼容客户端REST 路由注册Xinference 在 audio.py 中注册了POST /v1/audio/transcriptions路由透传到api.create_transcriptions若服务开启了认证该路由受models:readscope 保护。该端点完全对齐 OpenAI 的 Audio Transcriptions 协议因此任何基于 OpenAI SDK 的代码只需替换base_url即可切换。用 Xinference 原生 Client 调用from xinference.client import Client client Client(http://localhost:9997) model_uid client.launch_model( model_nameparaformer-zh-long, model_typeaudio, ) model client.get_model(model_uid) with open(meeting.mp3, rb) as f: audio f.read() # 默认返回 json仅 text result model.transcriptions(audio) print(result[text]) # verbose_json 返回带时间戳的完整结构 verbose model.transcriptions(audio, response_formatverbose_json) print(verbose[segments])用 OpenAI SDK 调用零代码迁移仓库测试 test_funasr.py 验证了 OpenAI SDK 的完整兼容路径import openai client openai.Client(api_keynot empty, base_urlhttp://localhost:9997/v1) with open(common_voice_zh-CN_38026095.mp3, rb) as f: completion client.audio.transcriptions.create(modelparaformer-zh-long, filef) print(completion.text)verbose_json 的返回结构当response_formatverbose_json时FunASRModel内部通过convert_to_openai_format将 FunASR 原始输出转换为 OpenAI 兼容结构见 funasr.pytext全文转写结果duration按首个与末尾词时间戳计算的音频时长秒words词级时间戳数组每项含start/end秒segments句级分段数组每项含id、start、end、text当模型带说话人分离能力时如paraformer-zh-spk还会包含speaker字段。测试 test_funasr.py 中针对paraformer-zh-spk断言了len(response[words]) 22与 segment 数量印证了该输出结构在 FunASR 家族中的一致性。验证与回归仓库测试给出的使用范式当前仓库的 test_funasr.py 提供了两类可直接借鉴的验证范式中英文双语冒烟测试test_restful_api_for_funasr用jfk.flac英文与common_voice_zh-CN_38026095.mp3中文验证转写正确性中文用例断言输出包含列表香港航空等关键词说明该系列模型可直接处理 MP3 格式中文音频。verbose_json 结构测试test_verbose_for_funasr验证segments与words字段的完整性。同家族模型横向定位在 Audio Models 索引 中paraformer-zh-long与以下兄弟模型同属funasr家族可从 model_spec.json 中对比它们的差异以便选型paraformer-zh基础版 Paraformer-large ASR无长音频专项优化model_spec.jsonparaformer-zh-hotword支持hotword热词配置的上下文版适合专业术语、人名地名识别model_spec.jsonparaformer-zh-spk在 VAD 标点基础上额外加载spk_model: cam说话人分离模型segments输出带speaker字段适合多人会议转写model_spec.jsonseaco-paraformer-zh支持hotword的 SEACO 变体model_spec.json。若任务场景是一段 5 分钟以上的中文长音频、需要自动切分与标点paraformer-zh-long是默认首选若还需要区分说话人则切换到paraformer-zh-spk。小结paraformer-zh-long是 Xinference 内置的、面向中文长音频的 FunASR 家族 ASR 模型一条xinference launch命令即可完成启动底层由 FSMN-VAD 切分长音频、CT-Punc 恢复标点并通过 OpenAI 兼容的/v1/audio/transcriptions端点对外提供json与verbose_json两种输出。理解其默认配置与接口限制后你可以用最少的代码将其接入现有的语音处理流水线并借助仓库中的模型注册表model_spec.json与测试用例test_funasr.py快速完成选型与验收。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询