MiniCPM-V 2.6 全面解读:8B 参数实现单图、多图与视频理解的开源多模态大模型
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
MiniCPM-V 2.6 是 MiniCPM-V 系列中基于 SigLip-400M 视觉编码器与 Qwen2-7B 语言模型构建的 8B 参数多模态大模型(MLLM),它在单图理解上取得领先的评测成绩,同时首次在该系列中引入多图对话推理、上下文学习(ICL)与视频输入理解能力。本文以仓库文档 docs/minicpm_v2dot6_zh.md 为主体,结合仓库内的推理脚本、Web Demo 与微调配置,完整还原该模型的架构特点、评测数据、模型选型与端到端部署方案,帮助读者掌握从加载权重、多图/视频对话到量化部署与微调的全链路实战技能。
模型概览:为什么 8B 参数能覆盖单图、多图与视频三大场景
MiniCPM-V 2.6 定位为"口袋级"多模态大模型,其架构组合为:
- 视觉编码器:SigLip-400M,负责将图像编码为视觉特征;
- 语言模型(LLM):Qwen2-7B,负责语言理解与生成;
- 连接模块:从仓库 chat.py 中
MiniCPMV2_6类的实现可以看到,模型结构中包含vpm(视觉处理模块)、resampler(视觉 token 压缩重采样器)与llm(Qwen2 解码器)三个核心组件,这与 MiniCPM-V 2.6 官方权重结构一致,no_split_module_classes中指定的SiglipVisionTransformer、Qwen2DecoderLayer也印证了上述架构组成。
总参数量约 8B。与上一代 MiniCPM-Llama3-V 2.5 相比,性能提升显著,并新增了多图与视频理解能力。这一架构选择使模型在保持高视觉理解精度的同时,将视觉 token 数量压缩到极致——仅需 640 个 token 即可处理 180 万像素图像(如 1344×1344),比大多数模型少 75%,为端侧实时视频理解提供了效率基础。
六大核心特性速览
🔥 单图理解:8B 量级对标主流商用闭源模型
在最新版本 OpenCompass 榜单上(综合 8 个主流多模态评测基准),MiniCPM-V 2.6 平均得分 65.2,以 8B 量级的参数量在单图理解方面超越 GPT-4o mini、GPT-4V、Gemini 1.5 Pro 和 Claude 3.5 Sonnet 等主流商用闭源多模态大模型。
🖼️ 多图理解与上下文学习
支持多图对话和推理,在 Mantis-Eval、BLINK、Mathverse mv 和 Sciverse mv 等主流多图评测基准中取得最佳水平,并展现出优秀的上下文学习(In-Context Learning, ICL)能力——即在对话中给出若干示例后,模型能够"照葫芦画瓢"地回答后续问题。
🎬 视频理解
接受视频输入并进行对话,可提供涵盖时序(temporal)和空间(spatial)信息的详细视频描述。在有无字幕两种评测场景下的 Video-MME 表现均超过 GPT-4V、Claude 3.5 Sonnet 和 LLaVA-NeXT-Video-34B 等商用闭源或更大规模模型。
💪 强大的 OCR 能力与其他能力
- 支持任意长宽比图像,最大像素数可达 180 万(如 1344×1344);
- 在 OCRBench 上取得最佳水平,超过 GPT-4o、GPT-4V 和 Gemini 1.5 Pro 等商用闭源模型;
- 基于 RLAIF-V 与 VisCPM 技术,具备可信的多模态行为,在 Object HalBench 上的幻觉率显著低于 GPT-4o 和 GPT-4V;
- 支持英语、中文、德语、法语、意大利语、韩语等多种语言。
🚀 卓越的效率:最先进的视觉 token 密度
视觉 token 密度(Token Density)定义为最大分辨率下的像素数 ÷ 视觉 token 数,即每个视觉 token 编码的像素数量。MiniCPM-V 2.6 的 token 密度达到 2822,位居对比模型首位。高 token 密度直接优化了推理速度、首 token 延迟、内存占用和功耗,从而支撑 iPad 等终端设备上的高效实时视频理解。
💫 易于使用
- llama.cpp / Ollama:支持在本地设备上进行高效的 CPU 推理;
- int4 / GGUF 量化模型:提供多种尺寸,适配低资源设备;
- vLLM:高吞吐量和内存高效的推理;
- 微调:针对新领域和新任务进行微调;
- Gradio WebUI:快速搭建本地演示界面;
- 在线 demo:无需本地环境即可体验。
性能评估:单图、多图、视频与少样本四张完整评测表
注:表中带
*的分数使用思维链(Chain-of-Thought, CoT)提示词评估;带+的 Token Density 为最大分辨率下每个视觉 token 编码的像素数,闭源模型的 Token Density 由 API 收费方式估算得到。
模型综合能力雷达图(来源于仓库 assets/radar_final.png):
单图评测:12 项基准完整对比
| Model | Size | Token Density+ | OpenCompass | MME | MMVet | OCRBench | MMMU val | MathVista mini | MMB1.1 test | AI2D | TextVQA val | DocVQA test | HallusionBench | Object HalBench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Proprietary | ||||||||||||||
| GPT-4o | - | 1088 | 69.9 | 2328.7 | 69.1 | 736 | 69.2 | 61.3 | 82.2 | 84.6 | - | 92.8 | 55.0 | 17.6 |
| Claude 3.5 Sonnet | - | 750 | 67.9 | 1920.0 | 66.0 | 788 | 65.9 | 61.6 | 78.5 | 80.2 | - | 95.2 | 49.9 | 13.8 |
| Gemini 1.5 Pro | - | - | 64.4 | 2110.6 | 64.0 | 754 | 60.6 | 57.7 | 73.9 | 79.1 | 73.5 | 86.5 | 45.6 | - |
| GPT-4o mini | - | 1088 | 64.1 | 2003.4 | 66.9 | 785 | 60.0 | 52.4 | 76.0 | 77.8 | - | - | 46.1 | 12.4 |
| GPT-4V | - | 1088 | 63.5 | 2070.2 | 67.5 | 656 | 61.7 | 54.7 | 79.8 | 78.6 | 78.0 | 87.2 | 43.9 | 14.2 |
| Step-1V | - | - | 59.5 | 2206.4 | 63.3 | 625 | 49.9 | 44.8 | 78.0 | 79.2 | 71.6 | - | 48.4 | - |
| Qwen-VL-Max | - | 784 | 58.3 | 2281.7 | 61.8 | 684 | 52.0 | 43.4 | 74.6 | 75.7 | 79.5 | 93.1 | 41.2 | 13.4 |
| Open-source | ||||||||||||||
| LLaVA-NeXT-Yi-34B | 34B | 157 | 55.0 | 2006.5 | 50.7 | 574 | 48.8 | 40.4 | 77.8 | 78.9 | 69.3 | - | 34.8 | 12.6 |
| Mini-Gemini-HD-34B | 34B | 157 | - | 2141 | 59.3 | 518 | 48.0 | 43.3 | - | 80.5 | 74.1 | 78.9 | - | - |
| Cambrian-34B | 34B | 1820 | 58.3 | 2049.9 | 53.2 | 591 | 50.4 | 50.3 | 77.8 | 79.5 | 76.7 | 75.5 | 41.6 | 14.7 |
| GLM-4V-9B | 13B | 784 | 59.1 | 2018.8 | 58.0 | 776 | 46.9 | 51.1 | 67.9 | 71.2 | - | - | 45.0 | - |
| InternVL2-8B | 8B | 706 | 64.1 | 2215.1 | 54.3 | 794 | 51.2 | 58.3 | 79.4 | 83.6 | 77.4 | 91.6 | 45.0 | 21.3 |
| MiniCPM-Llama-V 2.5 | 8B | 1882 | 58.8 | 2024.6 | 52.8 | 725 | 45.8 | 54.3 | 72.0 | 78.4 | 76.6 | 84.8 | 42.4 | 10.3 |
| MiniCPM-V 2.6 | 8B | 2822 | 65.2 | 2348.4* | 60.0 | 852* | 49.8* | 60.6 | 78.0 | 82.1 | 80.1* | 90.8 | 48.1* | 8.2 |
从表中可以清晰看到:MiniCPM-V 2.6 在 OpenCompass(65.2)、MME(2348.4)、MMVet(60.0)、OCRBench(852)、MathVista mini(60.6)、TextVQA val(80.1)、HallusionBench(48.1)与 Object HalBench(8.2,幻觉率越低越好)上均取得对比组最佳,而参数量与 InternVL2-8B 相同(8B),远小于 LLaVA-NeXT-Yi-34B、Cambrian-34B 等 34B 模型。
多图评测:Mantis Eval、BLINK、Mathverse mv 等五项基准
| Model | Size | Mantis Eval | BLINK val | Mathverse mv | Sciverse mv | MIRB |
|---|---|---|---|---|---|---|
| Proprietary | ||||||
| GPT-4V | - | 62.7 | 54.6 | 60.3 | 66.9 | 53.1 |
| LLaVA-NeXT-Interleave-14B | 14B | 66.4 | 52.6 | 32.7 | 30.2 | - |
| Open-source | ||||||
| Emu2-Chat | 37B | 37.8 | 36.2 | - | 27.2 | - |
| CogVLM | 17B | 45.2 | 41.1 | - | - | - |
| VPG-C | 7B | 52.4 | 43.1 | 24.3 | 23.1 | - |
| VILA 8B | 8B | 51.2 | 39.3 | - | 36.5 | - |
| InternLM-XComposer-2.5 | 8B | 53.1* | 48.9 | 32.1* | - | 42.5 |
| InternVL2-8B | 8B | 59.0* | 50.9 | 30.5* | 34.4* | 56.9* |
| MiniCPM-V 2.6 | 8B | 69.1 | 53.0 | 84.9 | 74.9 | 53.8 |
(表中带*的为正式开源模型权重的评测结果。)MiniCPM-V 2.6 在 Mantis Eval(69.1)、BLINK val(53.0)、Mathverse mv(84.9)、Sciverse mv(74.9)上均取得最佳,其中 Mathverse mv 84.9 分相比 GPT-4V 的 60.3 分有显著优势,说明其在数学类多图推理上具备极强的上下文组合理解能力。
视频评测:Video-MME 与 Video-ChatGPT
| Model | Size | Video-MME w/o subs | Video-MME w subs | Video-ChatGPT Correctness | Detail | Context | Temporal | Consistency |
|---|---|---|---|---|---|---|---|---|
| Proprietary | ||||||||
| Claude 3.5 Sonnet | - | 60.0 | 62.9 | - | - | - | - | - |
| GPT-4V | - | 59.9 | 63.3 | - | - | - | - | - |
| Open-source | ||||||||
| LLaVA-NeXT-7B | 7B | - | - | 3.39 | 3.29 | 3.92 | 2.60 | 3.12 |
| LLaVA-NeXT-34B | 34B | - | - | 3.29 | 3.23 | 3.83 | 2.51 | 3.47 |
| CogVLM2-Video | 12B | - | - | 3.49 | 3.46 | 3.23 | 2.98 | 3.64 |
| LongVA | 7B | 52.4 | 54.3 | 3.05 | 3.09 | 3.77 | 2.44 | 3.64 |
| InternVL2-8B | 8B | 54.0 | 56.9 | - | - | - | - | - |
| InternLM-XComposer-2.5 | 8B | 55.8 | - | - | - | - | - | - |
| LLaVA-NeXT-Video | 32B | 60.2 | 63.0 | 3.48 | 3.37 | 3.95 | 2.64 | 3.28 |
| MiniCPM-V 2.6 | 8B | 60.9 | 63.6 | 3.59 | 3.28 | 3.93 | 2.73 | 3.62 |
MiniCPM-V 2.6 在 Video-MME 无字幕(60.9)与有字幕(63.6)两项均超过 GPT-4V 与 Claude 3.5 Sonnet,同时 Video-ChatGPT 的 Correctness(3.59)、Context(3.93)与 Consistency(3.62)也处于领先水平,表明 8B 模型同样具备可靠的视频时序理解能力。
少样本(Few-shot)评测:TextVQA、VizWiz、VQAv2、OK-VQA
| Model | Size | Shot | TextVQA val | VizWiz test-dev | VQAv2 test-dev | OK-VQA val |
|---|---|---|---|---|---|---|
| Flamingo | 80B | 0* | 35.0 | 31.6 | 56.3 | 40.6 |
| 4 | 36.5 | 39.6 | 63.1 | 57.4 | ||
| 8 | 37.3 | 44.8 | 65.6 | 57.5 | ||
| IDEFICS | 80B | 0* | 30.9 | 36.0 | 60.0 | 45.2 |
| 4 | 34.3 | 40.4 | 63.6 | 52.4 | ||
| 8 | 35.7 | 46.1 | 64.8 | 55.1 | ||
| OmniCorpus | 7B | 0* | 43.0 | 49.8 | 63.2 | 45.5 |
| 4 | 45.4 | 51.3 | 64.5 | 46.5 | ||
| 8 | 45.6 | 52.2 | 64.7 | 46.6 | ||
| Emu2 | 37B | 0 | 26.4 | 40.4 | 33.5 | 26.7 |
| 4 | 48.2 | 54.6 | 67.0 | 53.2 | ||
| 8 | 49.3 | 54.7 | 67.8 | 54.1 | ||
| MM1 | 30B | 0 | 26.2 | 40.4 | 48.9 | 26.7 |
| 8 | 49.3 | 54.7 | 70.9 | 54.1 | ||
| MiniCPM-V 2.6+ | 8B | 0 | 43.9 | 33.8 | 45.4 | 23.9 |
| 4 | 63.6 | 60.5 | 65.5 | 50.1 | ||
| 8 | 64.6 | 63.4 | 68.2 | 51.4 |
(表中*表示使用 Flamingo 方式 zero image shot 和 two additional text shots 评估零样本性能;+表示在无监督微调(SFT)情况下直接评估预训练模型权重 ckpt。)在 4-shot 和 8-shot 场景下,MiniCPM-V 2.6 的 TextVQA(63.6 / 64.6)与 VizWiz(60.5 / 63.4)均为对比组最佳,且相比 0-shot 提升幅度巨大——这正是其上下文学习能力的直接体现。
典型示例:多图推理与端侧实时演示
官方提供的多图理解示例涵盖了实物对比、菜单推荐、代码阅读、ICL 记忆与多语言奖牌识别等典型场景,分别位于 assets/minicpmv2_6/multi_img-bike.png、assets/minicpmv2_6/multi_img-menu.png、assets/minicpmv2_6/multi_img-code.png、assets/minicpmv2_6/ICL-Mem.png 与 assets/minicpmv2_6/multiling-medal.png,更多示例(如 ICL 电器理解、多语言奥运场景)可查看 assets/minicpmv2_6/ICL-elec.png 与 assets/minicpmv2_6/multiling-olympic.png。
官方还将 MiniCPM-V 2.6 部署在 iPad Pro 上录制了实时演示,展示了其在端侧设备上的图像理解流畅度,动图见 assets/gif_cases/ai.gif 与 assets/gif_cases/beer.gif。
模型库:按设备与资源选择合适版本
| 模型 | 设备 | 资源 | 简介 |
|---|---|---|---|
| MiniCPM-V 2.6 | GPU | 17 GB | 提供出色的端侧单图、多图、视频理解能力 |
| MiniCPM-V 2.6 gguf | CPU | 6 GB | GGUF 版本,更低的内存占用和更高的推理效率 |
| MiniCPM-V 2.6 int4 | GPU | 7 GB | int4 量化版,更低显存占用 |
选择建议:拥有独立 GPU 且追求完整精度时使用原版(约 17 GB 显存);显存受限的 GPU 场景使用 int4 量化版(约 7 GB);希望在纯 CPU 设备上运行的场景使用 GGUF 版本(约 6 GB 内存)。三个版本均对应仓库 README_zh.md 模型库表中列出的官方权重发布(HuggingFace 与 ModelScope 双平台分发)。
实战:基于 Transformers 的推理
仓库 chat.py 提供了开箱即用的命令行推理入口,其中MiniCPMVChat会根据模型路径自动路由:路径含MiniCPM-V-2_6时自动加载MiniCPMV2_6类(见 chat.py)。MiniCPMV2_6的核心加载逻辑如下:
self.model = AutoModel.from_pretrained(model_path, trust_remote_code=True, attn_implementation='sdpa', torch_dtype=torch.bfloat16) self.model.eval().cuda() self.tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)从源码可以确认以下实现细节:
trust_remote_code=True:MiniCPM-V 2.6 的模型定义依赖远程代码(HuggingFace 上的 modeling 文件),加载时必须开启;attn_implementation='sdpa':使用 PyTorch 的 scaled dot-product attention 实现,兼顾速度与显存;torch_dtype=torch.bfloat16:以 bfloat16 半精度加载,是 17 GB 显存占用(而非 fp32 的 32 GB)的关键;- 多模态消息格式:
chat方法支持在对话内容中穿插图片与文本,content 既可以是字符串,也可以是{"type": "text"}/{"type": "image"}字典列表(见 chat.py),这正是多图对话的底层消息协议。
命令行推理示例(参照 chat.py 的 main 入口):
python chat.py脚本会加载模型、对./assets/worldmap_ck.jpg进行首轮提问与多轮追问,输出模型的连续对话回答。若希望使用其它模型路径,可在脚本末尾修改model_path变量(例如改为openbmb/MiniCPM-V-2_6)。
多 GPU 显存不够怎么办
MiniCPMV2_6类内置了多 GPU 串行推理支持(multi_gpus=True),通过accelerate的init_empty_weights+infer_auto_device_map+load_checkpoint_and_dispatch将不同模块分配到多张显卡:
- 视觉编码器
vpm、resampler与 LLM 首尾层放在device_id; - LLM 中段层(第 8~16 层)映射到第二块 GPU(
device_id2,即第 26 层所在设备),避免跨卡切分过多; - 关键约束:LLM 的第一层与最后一层必须位于同一设备(源码中显式将
llm.model.embed_tokens与llm.lm_head对齐到同一 device_id,见 chat.py)。
这为只有多张 10 GB 级显卡(如双卡场景)的用户提供了可行的推理路径,更详细的原理可参考仓库 docs/inference_on_multiple_gpus.md。
实战:Gradio 本地 WebUI Demo
仓库在 web_demos/web_demo_2.6.py 提供基于 Gradio 与 modelscope-studio 的完整 WebUI,支持图像、视频混合输入与多轮对话。
启动方式
# Nvidia GPU python web_demos/web_demo_2.6.py --device cuda # Mac(Apple Silicon 或 AMD GPU,MPS 后端) PYTORCH_ENABLE_MPS_FALLBACK=1 python web_demos/web_demo_2.6.py --device mps命令行参数(源码解析)
| 参数 | 默认值 | 说明 |
|---|---|---|
--device | cuda | 可选cuda或mps,分别对应 Nvidia GPU 与 Mac MPS |
--multi-gpus | False | 开启多 GPU 串行推理(与 chat.py 的 multi_gpus 逻辑一致) |
Demo 的输入处理细节
- 图像:支持 jpg/jpeg/png/bmp/tiff/webp,加载后若最长边超过
448*16(即 7168px)会等比缩放到该上限(encode_image); - 视频:支持 mp4/mkv/mov/avi/flv/wmv/webm/m4v,通过 decord 按 1 倍原始帧率均匀采样,最多取
MAX_NUM_FRAMES = 64帧,超过 64 帧时做均匀抽样(encode_video)——这是控制视频输入 token 总量的关键策略; - 消息组装:输入框使用
[mm_media]N[/mm_media]占位符将图片/视频插入对话文本流的任意位置,天然支持"多图 + 文本"交错对话; - 解码方式:界面提供 Beam Search / Sampling 两种解码方式切换,默认为 Sampling。
启动后模型会默认加载openbmb/MiniCPM-V-2_6(可在脚本中修改model_path),首次运行需联网下载权重。
高效部署:llama.cpp / Ollama(CPU)与 vLLM(GPU)
llama.cpp 与 Ollama:CPU 端侧推理
- GGUF 量化:官方发布 MiniCPM-V 2.6 GGUF 格式权重,适合 CPU 推理,约 6 GB 内存即可运行,llama.cpp 官方仓库已正式支持 MiniCPM-V 2.6;
- Ollama:同样提供对应支持,可像使用普通模型一样拉取与调用;
- 适用场景:无 GPU 的笔记本、树莓派类设备、需要隐私本地化的场景。
vLLM:高吞吐服务化部署
vLLM 支持 MiniCPM-V 2.6 的高吞吐量、内存高效推理,适合需要对外提供并发服务的生产场景。部署时同样需要指定--trust-remote-code,并注意:MiniCPM-V 2.6 的多图、视频推理会显著拉长输入序列(视频最多 64 帧),建议结合--max-model-len合理设置上下文长度,避免长序列截断。框架级部署的详细参数可参考仓库 README_zh.md 中"训练和推理框架与 API 支持"章节给出的各模型部署指南入口。
微调:为你的领域定制 MiniCPM-V 2.6
仓库 finetune/readme.md 提供了官方微调脚本,基于 Transformers Trainer 与 DeepSpeed,支持 MiniCPM-V 2.6 的全参数微调与 LoRA 微调。
数据格式:单图与多图
单图数据用<image>占位符指定图像插入位置;多图数据则使用字典形式,将<image_00>、<image_01>等占位符映射到具体图片路径,并在对话中交错引用:
{ "id": "0", "image": { "<image_00>": "path/to/image_0.jpg", "<image_01>": "path/to/image_1.jpg" }, "conversations": [ {"role": "user", "content": "请比较这两张图片中的商品\n<image_00>\n<image_01>\n"}, {"role": "assistant", "content": "..."} ] }token 与显存优化要点(源码确认)
- token 占用模型:2.6 版本中单张图片基础表示为 64 token,
slice=9(最大 1344×1344 分辨率)时单图约消耗64*(9+1)即 640 token——这与官方"640 token 处理 180 万像素"的效率指标完全对应; - 降低切片:设置
--max_slice_nums 1可将单图压缩为 64 token,适合大批量数据或长视频场景; - 多图 SFT:建议将
MODEL_MAX_LENGTH设为 4096,避免多图 token 超长截断; - OOM 缓解:依次尝试降低
--model_max_length、--batch_size、--max_slice_nums,或关闭视觉模块训练(--tune_vision false)、改用 LoRA、配置 DeepSpeed Zero-2/Zero-3 的 optimizer offload(配置样例见 finetune/ds_config_zero2.json 与 finetune/ds_config_zero3.json)。
启动训练
# 在 finetune/finetune_ds.sh 或 finetune/finetune_lora.sh 中配置: MODEL="openbmb/MiniCPM-V-2_6" # 模型路径 DATA="path/to/training_data.json" EVAL_DATA="path/to/test_data.json" LLM_TYPE="qwen" # MiniCPM-V 2.6 的 LLM 类型为 qwen sh finetune/finetune_ds.sh # 全参数微调 sh finetune/finetune_lora.sh # LoRA 微调A100(80GiB)环境下的官方显存统计:LoRA 微调约 13.1~14.4 GiB、全参数微调约 15.6~16.0 GiB(2/4/8 卡配置,DeepSpeed Zero-3 + 梯度检查点 + 优化器与参数 CPU offload,max length 2048、batch size 1)。训练完成后,LoRA 适配器可通过PeftModel.from_pretrained挂载回基座模型使用(参考 finetune/readme.md)。
从评测到落地:MiniCPM-V 2.6 的适用决策
综合上述信息,MiniCPM-V 2.6 的适用场景可归纳为:
- 高精度端侧部署:8B 规模 + 高 token 密度,可在 iPad Pro 等终端实现实时视频理解;
- 多图推理应用:文档比对、菜单推荐、多图代码阅读、ICL 少样本问答(如 VQA 类任务);
- 视频理解应用:时序+空间信息融合的短视频问答、视频摘要;
- OCR 与多语言场景:OCRBench 领先的任意长宽比文档识别,支持中英德法意韩等多语言;
- 低资源部署:int4(7 GB 显存)/ GGUF(6 GB 内存)量化版本 + llama.cpp / Ollama 支撑纯 CPU 运行;
- 领域定制:通过官方 finetune 脚本以 LoRA 方式低成本适配新任务。
若追求端侧实时视频能力与多图上下文学习,MiniCPM-V 2.6 是仓库中处于该技术路线关键节点的模型——它也是后续 MiniCPM-o 2.6(多模态流式交互)与 MiniCPM-V 4.x(更高效率压缩)系列演进的重要基石。
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考