MiniCPM-V 2.6 全面解读:8B 参数实现单图、多图与视频理解的开源多模态大模型
2026/9/11 5:06:40 网站建设 项目流程

MiniCPM-V 2.6 全面解读:8B 参数实现单图、多图与视频理解的开源多模态大模型

【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V

MiniCPM-V 2.6 是 MiniCPM-V 系列中基于 SigLip-400M 视觉编码器与 Qwen2-7B 语言模型构建的 8B 参数多模态大模型(MLLM),它在单图理解上取得领先的评测成绩,同时首次在该系列中引入多图对话推理、上下文学习(ICL)与视频输入理解能力。本文以仓库文档 docs/minicpm_v2dot6_zh.md 为主体,结合仓库内的推理脚本、Web Demo 与微调配置,完整还原该模型的架构特点、评测数据、模型选型与端到端部署方案,帮助读者掌握从加载权重、多图/视频对话到量化部署与微调的全链路实战技能。

模型概览:为什么 8B 参数能覆盖单图、多图与视频三大场景

MiniCPM-V 2.6 定位为"口袋级"多模态大模型,其架构组合为:

  • 视觉编码器:SigLip-400M,负责将图像编码为视觉特征;
  • 语言模型(LLM):Qwen2-7B,负责语言理解与生成;
  • 连接模块:从仓库 chat.py 中MiniCPMV2_6类的实现可以看到,模型结构中包含vpm(视觉处理模块)、resampler(视觉 token 压缩重采样器)与llm(Qwen2 解码器)三个核心组件,这与 MiniCPM-V 2.6 官方权重结构一致,no_split_module_classes中指定的SiglipVisionTransformerQwen2DecoderLayer也印证了上述架构组成。

总参数量约 8B。与上一代 MiniCPM-Llama3-V 2.5 相比,性能提升显著,并新增了多图与视频理解能力。这一架构选择使模型在保持高视觉理解精度的同时,将视觉 token 数量压缩到极致——仅需 640 个 token 即可处理 180 万像素图像(如 1344×1344),比大多数模型少 75%,为端侧实时视频理解提供了效率基础。

六大核心特性速览

🔥 单图理解:8B 量级对标主流商用闭源模型

在最新版本 OpenCompass 榜单上(综合 8 个主流多模态评测基准),MiniCPM-V 2.6 平均得分 65.2,以 8B 量级的参数量在单图理解方面超越 GPT-4o mini、GPT-4V、Gemini 1.5 Pro 和 Claude 3.5 Sonnet 等主流商用闭源多模态大模型。

🖼️ 多图理解与上下文学习

支持多图对话和推理,在 Mantis-Eval、BLINK、Mathverse mv 和 Sciverse mv 等主流多图评测基准中取得最佳水平,并展现出优秀的上下文学习(In-Context Learning, ICL)能力——即在对话中给出若干示例后,模型能够"照葫芦画瓢"地回答后续问题。

🎬 视频理解

接受视频输入并进行对话,可提供涵盖时序(temporal)和空间(spatial)信息的详细视频描述。在有无字幕两种评测场景下的 Video-MME 表现均超过 GPT-4V、Claude 3.5 Sonnet 和 LLaVA-NeXT-Video-34B 等商用闭源或更大规模模型。

💪 强大的 OCR 能力与其他能力

  • 支持任意长宽比图像,最大像素数可达 180 万(如 1344×1344);
  • 在 OCRBench 上取得最佳水平,超过 GPT-4o、GPT-4V 和 Gemini 1.5 Pro 等商用闭源模型;
  • 基于 RLAIF-V 与 VisCPM 技术,具备可信的多模态行为,在 Object HalBench 上的幻觉率显著低于 GPT-4o 和 GPT-4V;
  • 支持英语、中文、德语、法语、意大利语、韩语等多种语言。

🚀 卓越的效率:最先进的视觉 token 密度

视觉 token 密度(Token Density)定义为最大分辨率下的像素数 ÷ 视觉 token 数,即每个视觉 token 编码的像素数量。MiniCPM-V 2.6 的 token 密度达到 2822,位居对比模型首位。高 token 密度直接优化了推理速度、首 token 延迟、内存占用和功耗,从而支撑 iPad 等终端设备上的高效实时视频理解。

💫 易于使用

  • llama.cpp / Ollama:支持在本地设备上进行高效的 CPU 推理;
  • int4 / GGUF 量化模型:提供多种尺寸,适配低资源设备;
  • vLLM:高吞吐量和内存高效的推理;
  • 微调:针对新领域和新任务进行微调;
  • Gradio WebUI:快速搭建本地演示界面;
  • 在线 demo:无需本地环境即可体验。

性能评估:单图、多图、视频与少样本四张完整评测表

注:表中带*的分数使用思维链(Chain-of-Thought, CoT)提示词评估;带+的 Token Density 为最大分辨率下每个视觉 token 编码的像素数,闭源模型的 Token Density 由 API 收费方式估算得到。

模型综合能力雷达图(来源于仓库 assets/radar_final.png):

单图评测:12 项基准完整对比

ModelSizeToken Density+OpenCompassMMEMMVetOCRBenchMMMU valMathVista miniMMB1.1 testAI2DTextVQA valDocVQA testHallusionBenchObject HalBench
Proprietary
GPT-4o-108869.92328.769.173669.261.382.284.6-92.855.017.6
Claude 3.5 Sonnet-75067.91920.066.078865.961.678.580.2-95.249.913.8
Gemini 1.5 Pro--64.42110.664.075460.657.773.979.173.586.545.6-
GPT-4o mini-108864.12003.466.978560.052.476.077.8--46.112.4
GPT-4V-108863.52070.267.565661.754.779.878.678.087.243.914.2
Step-1V--59.52206.463.362549.944.878.079.271.6-48.4-
Qwen-VL-Max-78458.32281.761.868452.043.474.675.779.593.141.213.4
Open-source
LLaVA-NeXT-Yi-34B34B15755.02006.550.757448.840.477.878.969.3-34.812.6
Mini-Gemini-HD-34B34B157-214159.351848.043.3-80.574.178.9--
Cambrian-34B34B182058.32049.953.259150.450.377.879.576.775.541.614.7
GLM-4V-9B13B78459.12018.858.077646.951.167.971.2--45.0-
InternVL2-8B8B70664.12215.154.379451.258.379.483.677.491.645.021.3
MiniCPM-Llama-V 2.58B188258.82024.652.872545.854.372.078.476.684.842.410.3
MiniCPM-V 2.68B282265.22348.4*60.0852*49.8*60.678.082.180.1*90.848.1*8.2

从表中可以清晰看到:MiniCPM-V 2.6 在 OpenCompass(65.2)、MME(2348.4)、MMVet(60.0)、OCRBench(852)、MathVista mini(60.6)、TextVQA val(80.1)、HallusionBench(48.1)与 Object HalBench(8.2,幻觉率越低越好)上均取得对比组最佳,而参数量与 InternVL2-8B 相同(8B),远小于 LLaVA-NeXT-Yi-34B、Cambrian-34B 等 34B 模型。

多图评测:Mantis Eval、BLINK、Mathverse mv 等五项基准

ModelSizeMantis EvalBLINK valMathverse mvSciverse mvMIRB
Proprietary
GPT-4V-62.754.660.366.953.1
LLaVA-NeXT-Interleave-14B14B66.452.632.730.2-
Open-source
Emu2-Chat37B37.836.2-27.2-
CogVLM17B45.241.1---
VPG-C7B52.443.124.323.1-
VILA 8B8B51.239.3-36.5-
InternLM-XComposer-2.58B53.1*48.932.1*-42.5
InternVL2-8B8B59.0*50.930.5*34.4*56.9*
MiniCPM-V 2.68B69.153.084.974.953.8

(表中带*的为正式开源模型权重的评测结果。)MiniCPM-V 2.6 在 Mantis Eval(69.1)、BLINK val(53.0)、Mathverse mv(84.9)、Sciverse mv(74.9)上均取得最佳,其中 Mathverse mv 84.9 分相比 GPT-4V 的 60.3 分有显著优势,说明其在数学类多图推理上具备极强的上下文组合理解能力。

视频评测:Video-MME 与 Video-ChatGPT

ModelSizeVideo-MME w/o subsVideo-MME w subsVideo-ChatGPT CorrectnessDetailContextTemporalConsistency
Proprietary
Claude 3.5 Sonnet-60.062.9-----
GPT-4V-59.963.3-----
Open-source
LLaVA-NeXT-7B7B--3.393.293.922.603.12
LLaVA-NeXT-34B34B--3.293.233.832.513.47
CogVLM2-Video12B--3.493.463.232.983.64
LongVA7B52.454.33.053.093.772.443.64
InternVL2-8B8B54.056.9-----
InternLM-XComposer-2.58B55.8------
LLaVA-NeXT-Video32B60.263.03.483.373.952.643.28
MiniCPM-V 2.68B60.963.63.593.283.932.733.62

MiniCPM-V 2.6 在 Video-MME 无字幕(60.9)与有字幕(63.6)两项均超过 GPT-4V 与 Claude 3.5 Sonnet,同时 Video-ChatGPT 的 Correctness(3.59)、Context(3.93)与 Consistency(3.62)也处于领先水平,表明 8B 模型同样具备可靠的视频时序理解能力。

少样本(Few-shot)评测:TextVQA、VizWiz、VQAv2、OK-VQA

ModelSizeShotTextVQA valVizWiz test-devVQAv2 test-devOK-VQA val
Flamingo80B0*35.031.656.340.6
436.539.663.157.4
837.344.865.657.5
IDEFICS80B0*30.936.060.045.2
434.340.463.652.4
835.746.164.855.1
OmniCorpus7B0*43.049.863.245.5
445.451.364.546.5
845.652.264.746.6
Emu237B026.440.433.526.7
448.254.667.053.2
849.354.767.854.1
MM130B026.240.448.926.7
849.354.770.954.1
MiniCPM-V 2.6+8B043.933.845.423.9
463.660.565.550.1
864.663.468.251.4

(表中*表示使用 Flamingo 方式 zero image shot 和 two additional text shots 评估零样本性能;+表示在无监督微调(SFT)情况下直接评估预训练模型权重 ckpt。)在 4-shot 和 8-shot 场景下,MiniCPM-V 2.6 的 TextVQA(63.6 / 64.6)与 VizWiz(60.5 / 63.4)均为对比组最佳,且相比 0-shot 提升幅度巨大——这正是其上下文学习能力的直接体现。

典型示例:多图推理与端侧实时演示

官方提供的多图理解示例涵盖了实物对比、菜单推荐、代码阅读、ICL 记忆与多语言奖牌识别等典型场景,分别位于 assets/minicpmv2_6/multi_img-bike.png、assets/minicpmv2_6/multi_img-menu.png、assets/minicpmv2_6/multi_img-code.png、assets/minicpmv2_6/ICL-Mem.png 与 assets/minicpmv2_6/multiling-medal.png,更多示例(如 ICL 电器理解、多语言奥运场景)可查看 assets/minicpmv2_6/ICL-elec.png 与 assets/minicpmv2_6/multiling-olympic.png。

官方还将 MiniCPM-V 2.6 部署在 iPad Pro 上录制了实时演示,展示了其在端侧设备上的图像理解流畅度,动图见 assets/gif_cases/ai.gif 与 assets/gif_cases/beer.gif。

模型库:按设备与资源选择合适版本

模型设备资源简介
MiniCPM-V 2.6GPU17 GB提供出色的端侧单图、多图、视频理解能力
MiniCPM-V 2.6 ggufCPU6 GBGGUF 版本,更低的内存占用和更高的推理效率
MiniCPM-V 2.6 int4GPU7 GBint4 量化版,更低显存占用

选择建议:拥有独立 GPU 且追求完整精度时使用原版(约 17 GB 显存);显存受限的 GPU 场景使用 int4 量化版(约 7 GB);希望在纯 CPU 设备上运行的场景使用 GGUF 版本(约 6 GB 内存)。三个版本均对应仓库 README_zh.md 模型库表中列出的官方权重发布(HuggingFace 与 ModelScope 双平台分发)。

实战:基于 Transformers 的推理

仓库 chat.py 提供了开箱即用的命令行推理入口,其中MiniCPMVChat会根据模型路径自动路由:路径含MiniCPM-V-2_6时自动加载MiniCPMV2_6类(见 chat.py)。MiniCPMV2_6的核心加载逻辑如下:

self.model = AutoModel.from_pretrained(model_path, trust_remote_code=True, attn_implementation='sdpa', torch_dtype=torch.bfloat16) self.model.eval().cuda() self.tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)

从源码可以确认以下实现细节:

  • trust_remote_code=True:MiniCPM-V 2.6 的模型定义依赖远程代码(HuggingFace 上的 modeling 文件),加载时必须开启;
  • attn_implementation='sdpa':使用 PyTorch 的 scaled dot-product attention 实现,兼顾速度与显存;
  • torch_dtype=torch.bfloat16:以 bfloat16 半精度加载,是 17 GB 显存占用(而非 fp32 的 32 GB)的关键;
  • 多模态消息格式chat方法支持在对话内容中穿插图片与文本,content 既可以是字符串,也可以是{"type": "text"}/{"type": "image"}字典列表(见 chat.py),这正是多图对话的底层消息协议。

命令行推理示例(参照 chat.py 的 main 入口):

python chat.py

脚本会加载模型、对./assets/worldmap_ck.jpg进行首轮提问与多轮追问,输出模型的连续对话回答。若希望使用其它模型路径,可在脚本末尾修改model_path变量(例如改为openbmb/MiniCPM-V-2_6)。

多 GPU 显存不够怎么办

MiniCPMV2_6类内置了多 GPU 串行推理支持(multi_gpus=True),通过accelerateinit_empty_weights+infer_auto_device_map+load_checkpoint_and_dispatch将不同模块分配到多张显卡:

  • 视觉编码器vpmresampler与 LLM 首尾层放在device_id
  • LLM 中段层(第 8~16 层)映射到第二块 GPU(device_id2,即第 26 层所在设备),避免跨卡切分过多;
  • 关键约束:LLM 的第一层与最后一层必须位于同一设备(源码中显式将llm.model.embed_tokensllm.lm_head对齐到同一 device_id,见 chat.py)。

这为只有多张 10 GB 级显卡(如双卡场景)的用户提供了可行的推理路径,更详细的原理可参考仓库 docs/inference_on_multiple_gpus.md。

实战:Gradio 本地 WebUI Demo

仓库在 web_demos/web_demo_2.6.py 提供基于 Gradio 与 modelscope-studio 的完整 WebUI,支持图像、视频混合输入与多轮对话。

启动方式

# Nvidia GPU python web_demos/web_demo_2.6.py --device cuda # Mac(Apple Silicon 或 AMD GPU,MPS 后端) PYTORCH_ENABLE_MPS_FALLBACK=1 python web_demos/web_demo_2.6.py --device mps

命令行参数(源码解析)

参数默认值说明
--devicecuda可选cudamps,分别对应 Nvidia GPU 与 Mac MPS
--multi-gpusFalse开启多 GPU 串行推理(与 chat.py 的 multi_gpus 逻辑一致)

Demo 的输入处理细节

  • 图像:支持 jpg/jpeg/png/bmp/tiff/webp,加载后若最长边超过448*16(即 7168px)会等比缩放到该上限(encode_image);
  • 视频:支持 mp4/mkv/mov/avi/flv/wmv/webm/m4v,通过 decord 按 1 倍原始帧率均匀采样,最多取MAX_NUM_FRAMES = 64,超过 64 帧时做均匀抽样(encode_video)——这是控制视频输入 token 总量的关键策略;
  • 消息组装:输入框使用[mm_media]N[/mm_media]占位符将图片/视频插入对话文本流的任意位置,天然支持"多图 + 文本"交错对话;
  • 解码方式:界面提供 Beam Search / Sampling 两种解码方式切换,默认为 Sampling。

启动后模型会默认加载openbmb/MiniCPM-V-2_6(可在脚本中修改model_path),首次运行需联网下载权重。

高效部署:llama.cpp / Ollama(CPU)与 vLLM(GPU)

llama.cpp 与 Ollama:CPU 端侧推理

  • GGUF 量化:官方发布 MiniCPM-V 2.6 GGUF 格式权重,适合 CPU 推理,约 6 GB 内存即可运行,llama.cpp 官方仓库已正式支持 MiniCPM-V 2.6;
  • Ollama:同样提供对应支持,可像使用普通模型一样拉取与调用;
  • 适用场景:无 GPU 的笔记本、树莓派类设备、需要隐私本地化的场景。

vLLM:高吞吐服务化部署

vLLM 支持 MiniCPM-V 2.6 的高吞吐量、内存高效推理,适合需要对外提供并发服务的生产场景。部署时同样需要指定--trust-remote-code,并注意:MiniCPM-V 2.6 的多图、视频推理会显著拉长输入序列(视频最多 64 帧),建议结合--max-model-len合理设置上下文长度,避免长序列截断。框架级部署的详细参数可参考仓库 README_zh.md 中"训练和推理框架与 API 支持"章节给出的各模型部署指南入口。

微调:为你的领域定制 MiniCPM-V 2.6

仓库 finetune/readme.md 提供了官方微调脚本,基于 Transformers Trainer 与 DeepSpeed,支持 MiniCPM-V 2.6 的全参数微调与 LoRA 微调。

数据格式:单图与多图

单图数据用<image>占位符指定图像插入位置;多图数据则使用字典形式,将<image_00><image_01>等占位符映射到具体图片路径,并在对话中交错引用:

{ "id": "0", "image": { "<image_00>": "path/to/image_0.jpg", "<image_01>": "path/to/image_1.jpg" }, "conversations": [ {"role": "user", "content": "请比较这两张图片中的商品\n<image_00>\n<image_01>\n"}, {"role": "assistant", "content": "..."} ] }

token 与显存优化要点(源码确认)

  • token 占用模型:2.6 版本中单张图片基础表示为 64 token,slice=9(最大 1344×1344 分辨率)时单图约消耗64*(9+1)即 640 token——这与官方"640 token 处理 180 万像素"的效率指标完全对应;
  • 降低切片:设置--max_slice_nums 1可将单图压缩为 64 token,适合大批量数据或长视频场景;
  • 多图 SFT:建议将MODEL_MAX_LENGTH设为 4096,避免多图 token 超长截断;
  • OOM 缓解:依次尝试降低--model_max_length--batch_size--max_slice_nums,或关闭视觉模块训练(--tune_vision false)、改用 LoRA、配置 DeepSpeed Zero-2/Zero-3 的 optimizer offload(配置样例见 finetune/ds_config_zero2.json 与 finetune/ds_config_zero3.json)。

启动训练

# 在 finetune/finetune_ds.sh 或 finetune/finetune_lora.sh 中配置: MODEL="openbmb/MiniCPM-V-2_6" # 模型路径 DATA="path/to/training_data.json" EVAL_DATA="path/to/test_data.json" LLM_TYPE="qwen" # MiniCPM-V 2.6 的 LLM 类型为 qwen sh finetune/finetune_ds.sh # 全参数微调 sh finetune/finetune_lora.sh # LoRA 微调

A100(80GiB)环境下的官方显存统计:LoRA 微调约 13.1~14.4 GiB、全参数微调约 15.6~16.0 GiB(2/4/8 卡配置,DeepSpeed Zero-3 + 梯度检查点 + 优化器与参数 CPU offload,max length 2048、batch size 1)。训练完成后,LoRA 适配器可通过PeftModel.from_pretrained挂载回基座模型使用(参考 finetune/readme.md)。

从评测到落地:MiniCPM-V 2.6 的适用决策

综合上述信息,MiniCPM-V 2.6 的适用场景可归纳为:

  • 高精度端侧部署:8B 规模 + 高 token 密度,可在 iPad Pro 等终端实现实时视频理解;
  • 多图推理应用:文档比对、菜单推荐、多图代码阅读、ICL 少样本问答(如 VQA 类任务);
  • 视频理解应用:时序+空间信息融合的短视频问答、视频摘要;
  • OCR 与多语言场景:OCRBench 领先的任意长宽比文档识别,支持中英德法意韩等多语言;
  • 低资源部署:int4(7 GB 显存)/ GGUF(6 GB 内存)量化版本 + llama.cpp / Ollama 支撑纯 CPU 运行;
  • 领域定制:通过官方 finetune 脚本以 LoRA 方式低成本适配新任务。

若追求端侧实时视频能力与多图上下文学习,MiniCPM-V 2.6 是仓库中处于该技术路线关键节点的模型——它也是后续 MiniCPM-o 2.6(多模态流式交互)与 MiniCPM-V 4.x(更高效率压缩)系列演进的重要基石。

【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询