Sherpa-onnx v1.10.45 一文看懂:FireRedAsr 语音识别模型,手机和浏览器都能跑

发布时间:2026/9/12 17:44:07
Sherpa-onnx v1.10.45 一文看懂:FireRedAsr 语音识别模型,手机和浏览器都能跑 Sherpa-onnx v1.10.45 一文看懂:FireRedAsr 语音识别模型,手机和浏览器都能跑【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx想在产品里加一个不依赖网络的离线语音转写——用户一开口,设备立刻出文字——那 Sherpa-onnx v1.10.45 值得看一眼。它新增了 FireRedAsr 语音识别模型,把多语言语音识别能力带进手机、浏览器和各类边缘设备,做边缘设备语音识别部署多了一个现成选项。这次更新,一句话讲清楚v1.10.45 主要做了一件事:让 FireRedAsr 语音识别模型跑进 Sherpa-onnx,基于 ONNX(一种几乎在所有平台都能运行的模型文件格式)的语音识别引擎,覆盖的语言和硬件比之前更多;另外顺手修了两个小问题。如果你是移动端开发者( Android 或 iOS)、想做 WebAssembly 浏览器端推理的 Web 前端、边缘计算从业者,或者用 Go 绑定的,这条更新和你直接相关;只关心文本转语音的话,扫一眼即可。FireRedAsr 是什么,能帮你解决什么FireRedAsr 是一个端到端(AED)语音识别模型。所谓 AED,就是音频进、文字出:模型直接从声音里学规律,不用你手工拼特征、再级联声学模型这些中间环节。它的特点是识别准确率高、推理速度快,加上 ONNX 格式跨平台的特性,同一套模型能落到不同设备上。常见用法有这么几类: 手机离线转写:没网也能用,音频不出设备 浏览器端多语言识别:用 WebAssembly(让浏览器直接跑高性能计算的技术)在浏览器里完成推理,不用把音频传给服务端 边缘设备部署:在资源有限的设备上做转写任务下面是一个浏览器端语音识别的简易 Web 界面,提供上传文件 / 实时录音两种识别入口,可以直观感受浏览器端推理的形态:各平台接入方式一览模型已导出为 ONNX,各语言绑定都接好了,按你的平台挑就行:桌面端(C / Python):先想验证识别效果,用 Python 最省事;做服务或对性能有极致要求,选 C,示例在 cxx-api-examples/移动端(Android / iOS):Android 走 AAR 包,iOS 走 Framework。做手机 App 离线转写、又不想依赖云端,从这条路开始Web 端(WebAssembly / Node.js):浏览器跑 WASM 推理,Node.js 跑服务端。前后端同学可以翻 nodejs-examples/ 里的示例找手感其余语言(C# / Swift / Dart / C API / Pascal):接口都齐了,按你熟悉的技术栈选对应的那套即可顺手修掉的两个坑如果你用 Go 绑定:v1.10.45 修了一个隐患——之前个别情况下 Go 实例创建成功、对应的 C 结构体却初始化失败,可能引发内存访问问题。如果你在盯性能监控:实时因子计算里的一个拼写错误也修掉了。RTF 就是处理 1 秒音频要花多少秒,修掉后这个指标不会再出现计算偏差。选 FireRedAsr 之前,看准确率与量化两条权衡先说准确率与速度的权衡。FireRedAsr 和 Sherpa-onnx 已有的模型在识别准确率、推理速度上各有取舍,实际效果取决于你的语种和数据特点,建议先拿自己的真实音频测一轮再决定,别只看公开印象。再说量化与精度。ONNX 导出提供了多档精度选项,并做了图优化;量化指降低模型内部数值的精度,能换来更小的体积和更快的速度,但精度上会有代价,边缘设备上这笔账要自己算平。最低门槛的上手路径:先用 Python API 跑一把,确认效果符合预期,再决定用哪个平台的绑定,模型文件可以跨平台复用,不用重新导出。如果是要在不依赖云端的场景里做多语言语音识别,Sherpa-onnx v1.10.45 搭配 FireRedAsr 已经可以直接上手,对移动端和 Web 开发者尤其友好。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询