
MiniCPM-V 4.0 端侧多模态大模型详解4.1B 参数下的单图/多图/视频理解与 iPhone 部署实践【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V本文基于开源仓库 MiniCPM-V 中 docs/minicpm_v4_en.md 整理。MiniCPM-V 4.0 是 MiniCPM-V 系列中面向端侧部署的高效多模态大模型MLLM以 4.1B 总参数量在 OpenCompass 综合评测中获得 69.0 的平均分并可在 iPhone 16 Pro Max 上实现低于 2 秒首 token 延迟的实时图像理解。读完本文你将完整了解 MiniCPM-V 4.0 的架构构成、评测表现、端侧部署能力以及 llama.cpp、Ollama、vLLM、SGLang、LLaMA-Factory 等主流推理/微调生态的接入方式。一、模型概览面向端侧的高效 MLLMMiniCPM-V 4.0 于 2025 年 8 月 2 日随仓库发布见 README 发布记录被定位为 MiniCPM-V 系列中高能力与高效率兼顾的一代。它基于SigLIP2-400M视觉编码器与MiniCPM4-3B语言模型构建总参数约4.1B是当时系列中参数规模显著缩小的模型但完整继承了 MiniCPM-V 2.68.1B 参数在单图理解、多图理解与视频理解三方面的能力同时大幅提升了推理效率。在 README 的 Legacy Models 索引 中MiniCPM-V 4.0 由本文档docs/minicpm_v4_en.md作为其官方介绍与指引。二、三大核心特性官方文档将 MiniCPM-V 4.0 的特点概括为三点下面逐一展开。2.1 领先的视觉理解能力在仅 4.1B 参数的规模下MiniCPM-V 4.0 在OpenCompass 综合评测涵盖 8 个主流 benchmark 的平均分中达到69.0表现优于GPT-4.1-mini-20250414闭源得分 68.9MiniCPM-V 2.68.1B 参数得分 65.2即上一代同系列模型Qwen2.5-VL-3B-Instruct3.8B 参数得分 64.5。此外模型在多图理解与视频理解任务上也表现出色详见下文评测数据说明模型在缩小参数规模的同时没有牺牲多模态理解的上限。2.2 卓越的端侧推理效率MiniCPM-V 4.0 专为端侧on-device部署优化。官方在iPhone 16 Pro Max上完成了真机验证首 token 延迟小于 2 秒解码速度超过 17 tokens/s且无发热问题。同时模型在并发请求场景下表现出领先的吞吐率使其成为口袋级端侧多模态推理的现实选择。2.3 开箱即用的易用性MiniCPM-V 4.0 支持多种推理与微调方式覆盖从 CPU/手机到 GPU 服务器、从纯推理到领域微调的全链路推理llama.cpp、Ollama、vLLM、SGLang、本地 Web Demo微调LLaMA-Factory等端侧开源的iOS App可在 iPhone 与 iPad 上运行。配套的 MiniCPM-V CookBook 提供了结构化的部署指南与实战示例可直接作为快速上手的操作手册。三、评测表现单图 / 文档数学 / 多图与视频以下三张评测表完整取自官方文档数据为文档发布时2026-05-09 归档官方公布的评测结果供横向对比参考。3.1 OpenCompass 单图理解评测OpenCompass 平均分及 OCRBench、MathVista、HallusionBench、MMMU、MMVet、MMBench V1.1、MMStar、AI2D 八项细分指标如下模型SizeOpenCompassOCRBenchMathVistaHallusionBenchMMMUMMVetMMBench V1.1MMStarAI2DProprietary闭源GPT-4v-20240409-63.565655.243.961.767.579.856.078.6Gemini-1.5-Pro-64.575458.345.660.664.073.959.179.1GPT-4.1-mini-20250414-68.984070.949.355.074.380.960.976.0Claude 3.5 Sonnet-20241022-70.679865.355.566.470.181.765.181.2Open-source开源Qwen2.5-VL-3B-Instruct3.8B64.582861.246.651.260.076.856.381.4InternVL2.5-4B3.7B65.182060.846.651.861.578.258.781.4Qwen2.5-VL-7B-Instruct8.3B70.988868.151.958.069.782.264.184.3InternVL2.5-8B8.1B68.182164.549.056.262.882.563.284.6MiniCPM-V-2.68.1B65.285260.848.149.860.078.057.582.1MiniCPM-o-2.68.7B70.288973.351.150.967.280.663.386.1MiniCPM-V-4.04.1B69.089466.950.851.268.079.762.882.9值得注意MiniCPM-V 4.0 在OCRBench894上超过了表中所有对比模型说明其文档 OCR 能力在同级模型中处于领先位置同时以 4.1B 规模在 OpenCompass 平均分上逼近 8.3B 的 Qwen2.5-VL-7B-Instruct70.9。3.2 图表、文档、数学与幻觉专项评测在 ChartQA、MME、RealWorldQA、TextVQA、DocVQA、MathVision、DynaMath、WeMath 以及目标幻觉Object HalBenchCHAIRs/CHAIRi 越低越好与多模态幻觉MM HalBenchscore 越高越好、hall rate 越低越好等专项上的结果模型SizeChartQAMMERealWorldQATextVQADocVQAMathVisionDynaMathWeMathObj Hal CHAIRs↓Obj Hal CHAIRi↓MM Hal score avg3↑MM Hal hall rate avg3↓Proprietary闭源GPT-4v-20240409-78.5192761.478.088.4-------Gemini-1.5-Pro-87.2-67.578.893.141.031.550.5----GPT-4.1-mini-20250414------45.347.7-----Claude 3.5 Sonnet-20241022-90.8-60.174.195.235.635.744.0----Open-source开源Qwen2.5-VL-3B-Instruct3.8B84.0215765.479.393.921.913.222.918.310.83.933.3InternVL2.5-4B3.7B84.0233864.376.891.618.415.221.213.78.73.246.5Qwen2.5-VL-7B-Instruct8.3B87.3234768.584.995.725.421.836.213.37.94.131.6InternVL2.5-8B8.1B84.8234470.179.193.017.09.423.518.311.63.637.2MiniCPM-V-2.68.1B79.4234865.080.190.817.59.020.47.34.74.029.9MiniCPM-o-2.68.7B86.9237268.182.093.521.710.425.26.33.44.131.3MiniCPM-V-4.04.1B84.4229868.580.892.920.714.232.76.33.54.129.2从数据看MiniCPM-V 4.0 在数学类任务MathVision 20.7、DynaMath 14.2、WeMath 32.7上明显优于同规模的 Qwen2.5-VL-3B 与 InternVL2.5-4B在 WeMath 上甚至超过 8.1B 的 InternVL2.5-8B23.5幻觉抑制方面其目标幻觉 CHAIRs6.3与同系列 8.7B 的 MiniCPM-o-2.6 持平多模态幻觉 hall rate29.2为开源组最低表现接近上一代更大模型。3.3 多图与视频理解评测在 Mantis多图、Blink多图感知与 Video-MME视频理解含 w/o subs 与 w/ subs 两种字幕设定上的结果模型SizeMantisBlinkVideo-MME (wo subs)Video-MME (w subs)Proprietary闭源GPT-4v-20240409-62.754.659.963.3Gemini-1.5-Pro--59.175.081.3GPT-4o-20240513--68.071.977.2Open-source开源Qwen2.5-VL-3B-Instruct3.8B-47.661.567.6InternVL2.5-4B3.7B62.750.862.363.6Qwen2.5-VL-7B-Instruct8.3B-56.465.171.6InternVL2.5-8B8.1B67.754.864.266.9MiniCPM-V-2.68.1B69.153.060.963.6MiniCPM-o-2.68.7B71.956.763.969.6MiniCPM-V-4.04.1B71.454.061.265.8MiniCPM-V 4.0 在Mantis 多图理解71.4上超过了同系列更大的 MiniCPM-o-2.671.9 之下与 InternVL2.5-8B67.7说明其多图能力在 4.1B 规模下依然保持了系列优势视频理解Video-MME 61.2/65.8也与上一代 8.1B 的 MiniCPM-V-2.6 基本持平。四、端侧部署实践iPhone 16 Pro Max 真机演示官方在iPhone 16 Pro Max上部署了 MiniCPM-V 4.0 的 iOS Demo演示录屏为未经任何编辑的原始屏幕录制可直观验证首 token 延迟 2 秒、解码速度 17 tokens/s 的实际体验。以下为英文界面下的对话演示官方还提供了信息抽取、中文对话、趣味问答等多种场景的演示素材均位于 assets/minicpmv4/iphone_en_information_extraction.gif英文界面信息抽取演示iphone_cn.gif/iphone_cn_funny_points.gif中文界面对话与趣味问答演示。需要说明iOS App 的完整构建与部署代码位于仓库外的 MiniCPM-V CookBookdemo/ios_demo/ios.md本文仓库MiniCPM-V中不包含 iOS 工程源码如需在 iPhone/iPad 上复现该体验请以 CookBook 的 iOS 章节为准。五、推理与微调生态从本地 Web Demo 到主流框架MiniCPM-V 4.0 的易用性体现在多框架支持上。官方在 README 的框架支持表 中明确了各框架的接入方式以 CookBook 中的分框架指南为准框架MiniCPM-V 4.0 接入路径vLLMCookBookdeployment/vllm/minicpm-v4_vllm.mdSGLangCookBookdeployment/sglang/MiniCPM-v4_sglang.mdllama.cppCookBookdeployment/llama.cpp/minicpm-v4_llamacpp.mdOllamaCookBookdeployment/ollama/minicpm-v4_ollama.md微调LLaMA-FactoryCookBookfinetune/llama-factory/finetune_llamafactory.md同时仓库本身也提供了基于 Transformers 的推理范式可以参考。以同系列模型的推理实现为例chat.py 中的MiniCPMV类展示了标准的多模态推理调用方式——通过AutoModel.from_pretrained(..., trust_remote_codeTrue)加载模型再用model.chat(image..., msgs..., tokenizer..., samplingTrue, temperature0.7)完成图文对话。虽然该文件中的类对应更早的系列版本但remote code chat 接口这一设计贯穿 MiniCPM-V 系列可作为理解模型 API 用法的参考。其余系列版本的对话脚本如 web_demos/web_demo_2.6.py 等也沿用了相同思路。六、在仓库中的定位与延伸阅读官方文档入口本文档 docs/minicpm_v4_en.md 是 MiniCPM-V 4.0 的官方介绍README 的 Legacy Models 索引 已将其作为该模型的唯一指引文档中文对照版见 docs/minicpm_v4_zh.md。系列演进关系MiniCPM-V 4.0 继承自 MiniCPM-V 2.6 的能力与架构思路相关文档见 docs/minicpm_v2dot6_en.md并在其后的 4.5/4.6 版本中进一步演进见 docs/minicpm_v4dot5_en.md 与 README 中 MiniCPM-V 4.6 章节。同仓库可复用的通用能力仓库中的 eval_mm 评测工具、finetune 微调脚本与 docs/ 下的部署指南均为 MiniCPM-V 系列通用部署与评测 MiniCPM-V 4.0 时可直接复用。七、总结MiniCPM-V 4.0 是小参数、高能力、可端侧这一设计理念的代表作以SigLIP2-400M MiniCPM4-3B的 4.1B 架构在 OpenCompass 上取得 69.0 的平均分并超越同规格竞品与上一代 8.1B 模型在 OCRBench、WeMath、Mantis 等专项上表现突出同时在 iPhone 16 Pro Max 上实现小于 2 秒首 token 延迟、超过 17 tokens/s 的端侧解码。配合 llama.cpp、Ollama、vLLM、SGLang、LLaMA-Factory 与开源 iOS App 的完整生态MiniCPM-V 4.0 是落地手机上的图像与视频理解这一场景的实用选择。对于需要快速上手的开发者建议以本文数据做选型参考以 CookBook 的分框架指南做实际操作手册并以 docs/minicpm_v4_en.md 为官方信息源。【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考