vLLM一键部署WeMM-Embedding:生产级多模态Embedding服务完整实操指南

发布时间:2026/10/11 1:28:37
vLLM一键部署WeMM-Embedding:生产级多模态Embedding服务完整实操指南 人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载WeMM-Embedding 是腾讯微信视觉团队研发的通用多模态 Embedding 模型系列支持文本、图像、视频、视觉文档与交错多模态输入。本文带你用vLLM 一条命令一键部署 WeMM-Embedding快速搭建生产级多模态 Embedding 服务并验证检索效果、灵活控制 Embedding 维度。为什么选择 WeMM-Embedding 做多模态 Embedding 服务在搭建图片搜索、以文搜视频、视觉文档检索VisRAG等服务时最大的痛点往往是文本一个模型、图像一个模型、视频又一个模型向量空间互相不通用。WeMM-Embedding 的价值在于统一——所有模态输入都映射到同一个向量空间天然支持跨模态检索。它的核心特点全模态统一表示文本、图像、视频、视觉文档、图文交错输入共用一套模型SOTA 性能在 MMEB-v278 个数据集上 9B 版本综合得分 80.6图像 81.9、视频 74.3、视觉文档 83.3全面领先开源模型三档模型2B / 4B / 9B 按需选择显存与效果自由权衡Matryoshka 嵌入支持 64~4096 维灵活截取小维度下性能几乎无损模型库一览Matryoshka 支持维度模型支持维度WeMM-Embedding-2B64, 128, 256, 512, 1024, 2048WeMM-Embedding-4B64, 128, 256, 512, 1024, 2560WeMM-Embedding-9B64, 128, 256, 512, 1024, 2048, 4096Embedding 取自专用embeddingtoken 位置的最后一层 hidden state 并做 L2 归一化当前暂不支持音频输入。部署前准备安装依赖与获取模型步骤 1克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/we/WeMM-Embedding.git cd WeMM-Embedding pip install -r requirements.txt依赖清单见 requirements.txt其中transformers5.2.0为官方推荐版本新版本可能在预处理行为上存在差异。同时安装官方验证过的 vLLM 版本pip install vllm0.27.0步骤 2下载模型权重从 Hugging Face 下载对应模型例如 2B 版tencent/WeMM-Embedding-2B放到本地任意目录即可。注意模型目录中的embedding_chat_template.jinja文件后续部署要用到。 显存参考建议2B 模型适合单张 16GB 显卡9B 模型建议 24GB 及以上显存的 GPU。vLLM 一键启动多模态 Embedding 服务部署命令方法一手动执行 vllm serve理解原理MODEL_PATH/path/to/WeMM-Embedding-2B vllm serve $MODEL_PATH \ --runner pooling \ --chat-template $MODEL_PATH/embedding_chat_template.jinja两个关键参数解释--runner pooling声明这是一个池化型poolingEmbedding 模型vLLM 会走 Embedding 推理路径而非自回归生成--chat-template指定模型自带的专用对话模板负责正确拼装输入并自动追加embeddingtoken无需手动处理方法二用仓库内置脚本真正一键启动推荐官方已封装好等价脚本 scripts/serve_vllm.sh只需传入模型路径bash scripts/serve_vllm.sh /path/to/WeMM-Embedding-2B看到Uvicorn running on http://0.0.0.0:8000即表示服务已就绪默认提供 OpenAI 兼容的/v1/embeddings接口。调用 Embedding 接口验证服务是否生效服务启动后用下面这条 curl 即可同时编码一句中文和一句英文验证文本 Embedding 输出curl -s http://localhost:8000/v1/embeddings \ -H Content-Type: application/json \ -d { model: /path/to/WeMM-Embedding-2B, input: [一只在海滩上奔跑的狗, a dog is running on a beach] }返回的向量已 L2 归一化可直接用于余弦相似度检索。图像、视频等输入同样通过该接口以 base64 方式传入与文本共享同一向量空间这正是多模态 Embedding 服务的核心能力。想先在本地脚本层面跑通完整推理流程文本/图像/视频各生成一条向量可以参考官方示例 examples/transformers_inference.py 和 examples/sentence_transformers_inference.py。上图为典型的图像检索素材——以这样一张照片为 queryWeMM-Embedding 可以检索出语义相同的相似图也可以用文字描述反向搜图。9B 模型在 MMEB-v2 图像任务上得分 81.9、视频 74.3。视觉文档检索VisRAG是它另一个杀手级场景对下面这类数据可视化图表文档模型能以问答语句精准召回对应文档页MMEB-v2 VisDoc 任务得分高达 83.3NDCG5。用 Matryoshka 维度灵活控制存储与检索成本向量库的成本与 Embedding 维度成正比。WeMM-Embedding 支持 Matryoshka 表示学习对完整向量截取前 d 维后重新归一化即可得到合法的小维度向量embedding torch.nn.functional.normalize(embedding[..., :d], dim-1)在 MMEB-v2 上2B 模型仅用256 维就能保留完整维度图像/视频性能的98.7%。生产上可以查询侧用低维保速度、索引侧用高维保精度或全链路低维大幅压缩向量库容量。常见问题与生产级建议版本必须对齐官方验证过的组合是 vLLM0.27.0/ SGLang0.5.9。若想改用 SGLang仓库同样提供一键脚本 scripts/serve_sglang.sh它会自动执行 scripts/patch_sglang_video.py 为视频预处理打补丁无需手动处理。不要手动加embeddingtoken它由模型侧 chat template 自动追加重复添加会导致向量错误。音频暂不支持模型没有音频塔相关任务请选其他方案。效果存疑时先复跑基准仓库内置完整的 MMEB-v3 评测流水线 mmeb_v3_eval/支持单机与多机多卡复现官方数据torchrun --nnodesN。深入阅读更多训练与评测细节可查阅技术报告 assets/WeMM_Embedding_tech_report.pdf。总结到这里你已经完成了一条完整的生产链路一条命令vLLM→ 多模态 Embedding 服务 → 统一向量空间 → Matryoshka 控成本。WeMM-Embedding 把文本、图像、视频、文档检索统一到同一个 API 之下是构建跨模态搜索、RAG 和推荐系统的理想底座。如果还想验证更细粒度的基准表现mmeb_v3_eval/ 评测代码可以直接帮你复现全部 190 个任务的得分。赞分享人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载相关推荐在 Xinference 中部署 WeMM-Embedding-4B多模态嵌入模型的完整实战指南在 Xinference 中部署 WeMM Embedding 4B多模态嵌入模型的完整实战指南 WeMM Embedding 4B 是 Xinference模型推理服务人工智能大模型本地部署多模态语音在 Xinference 中部署与调用 WeMM-Embedding-2B 多模态向量模型在 Xinference 中部署与调用 WeMM Embedding 2B 多模态向量模型 WeMM Embedding 2B 是腾讯 Hunyuan 团队发布模型推理服务人工智能大模型本地部署多模态语音猫抓 Cat-Catch3 步装好在线视频与 M3U8 流一键合并下载猫抓 Cat Catch3 步装好在线视频与 M3U8 流一键合并下载 猫抓cat catch是一款开源的浏览器资源嗅探扩展它自动捕获网页加载的视频、音视频创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询