如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件?

发布时间:2026/9/13 5:29:35
如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件? 如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI手头有一段录音想知道里面出现了哪些声音——婴儿哭声、玻璃破碎、狗叫、警报——这就是声音事件分类sound-event classification也叫 audio tagging要回答的问题我听到的是什么 LocalAI 通过/v1/audio/classification端点提供这个能力给定一段音频返回一组带分数的 AudioSet 标签。参考后端是ced.cppCED527 类 AudioSet 标签器一个作用于 log-mel 谱图的小型 ViT移植到 ggml 且与 PyTorch 完全对齐Apache-2.0 权重的 GGUF 文件可以直接从模型画廊安装。该端点按照/v1/audio/transcriptions的样式建模任何 HTTP 客户端都能调用消费端没有 Python 依赖。运行 LocalAI 并安装分类模型按本文的前提你需要已安装并可运行 LocalAI。以 Docker 为例见 快速上手docker run -p 8080:8080 --name local-ai -ti localai/localai:latest使用命令行时可以在启动时直接指定要安装的模型LocalAI 会在 API 启动前完成下载。声音分类主路径使用的模型是画廊中的ced-base-f16见 ced 模型定义后端为ced声明了sound_classification用例local-ai run ced-base-f16也可以用 CLI 单独管理模型local-ai models list # 查看画廊中的模型 local-ai models install ced-base-f16 # 安装模型关于模型变体gallery/index.yaml 中列出了同一ced后端的一系列 GGUF 权重ced-base-f16是描述中标注的推荐默认CPU 上最快、near-lossless如果在意占用空间ced-base-q8约 88 MB比 PyTorch 参考实现省约 6.5 倍内存top-5 标签一致、ced-tiny-*5.5M 参数面向 Pi 级/边缘设备、ced-mini-*9.6M 参数与ced-small-*22M 参数也是同端点可用的替代。后文示例统一使用ced-base-f16换成其它变体时只需把-F model的值换成对应名称。调用 /v1/audio/classification 端点端点为POST /v1/audio/classification Content-Type: multipart/form-data请求字段如下来自 audio-classification 文档字段类型说明file文件必填音频文件ffmpeg能接受的任意格式model字符串必填具备声音分类能力的模型名如ced-base-f16top_k整数返回的 top 标签数量0 使用后端默认值threshold浮点数丢弃低于该分数的标签发送分类请求把/path/to/clip.wav替换为你自己的音频文件路径curl http://localhost:8080/v1/audio/classification \ -H Content-Type: multipart/form-data \ -F file/path/to/clip.wav \ -F modelced-base-f16 \ -F top_k10其中top_k10是可选参数控制最多返回多少条标签threshold同理可加用于过滤低置信度标签。如何判断请求成功响应体包含两部分{ model: ced-base-f16, detections: [ {index: 23, label: Baby cry, infant cry, score: 0.87}, {index: 22, label: Crying, sobbing, score: 0.41} ] }以上为源文档给出的示例输出实际标签和分数取决于你的音频内容。判断方式与需要了解的语义detections是一个数组按分数从高到低排列每条包含indexAudioSet 标签编号、label标签文本和score分数。分数是每类的独立概率多标签、相互独立因此所有分数的和不等于 1——不要按总和接近 1来校验结果。只要拿到形如上述结构的 JSON 且detections非空说明端点、模型和音频链路都已工作detections为空或标签不符合预期时优先检查file是否为有效音频、model是否指向已安装的 ced 模型。分布式模式下的行为如果你的部署是分布式模式API 前端 独立 worker文档说明 LocalAI 会在选定的 worker 上先暂存上传的音频以及实时声音检测窗口再执行分类API 服务器与 worker 之间不需要共享临时目录。也就是说本文的 curl 示例在分布式部署下同样适用不需要额外配置共享盘。边界与下一步file字段的格式由ffmpeg决定ffmpeg不接受的格式会失败model必须是声明了声音分类能力的模型即ced后端的 ced 系列 GGUF指向普通 LLM/语音转写模型不会有分类结果本文只覆盖对已录制音频片段的分类。LocalAI 还通过 realtime websocket API 提供实时声音识别见 audio-classification 文档以及相近的 语音转写audio to text 和 说话人分离audio diarization它们解决的是说了什么和谁在说与本场景的听到什么声音事件是不同任务。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询