openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

openbmb/MiniCPM-o-4_5 是一款 9B 参数多模态模型,适用于视觉、语音、OCR 和全双工直播工作流,支持 instruct 与 thinking 模式,以及 PyTorch、llama.cpp、Ollama、vLLM、SGLang 等部署方式。

openbmb/MiniCPM-o-4_5

概述

MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上发布的一款多模态模型,将视觉、语音和直播能力整合到一个端到端系统中。模型卡将其描述为 MiniCPM-o 系列中最新、能力最强的模型,由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 构建,参数量为 9B。

来源突出说明了该模型的四项主要任务:视觉理解、实时语音对话、全双工多模态直播以及 OCR/文档解析。它还指出,该模型支持英语和中文双语语音、总体超过 30 种语言,以及多种部署路径,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、vLLM、SGLang、量化格式和 FlagOS。

主要特性

9B 参数多模态模型

该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总参数量为 9B,并被介绍为 MiniCPM-o 系列中的最新模型。

Instruct 和 thinking 模式

MiniCPM-o 4.5 在单一模型中同时支持 instruct 和 thinking 模式,用户可以在更快响应和更深入推理之间进行选择,而无需切换模型。

语音对话功能

该模型支持英语和中文的双语实时语音对话,可配置助手声音、声音克隆,以及基于一段简短参考音频的角色扮演。

全双工直播

它可以在生成文本和语音输出的同时处理连续音频和视频流,实现不受模态之间阻塞影响的全双工直播交互。

高分辨率视觉输入

该模型可处理高达 180 万像素的高分辨率图像和最高 10 fps 的高帧率视频,并且在 OCR 和文档解析任务上表现较强。

多种推理与部署选项

页面列出了多种部署路径,包括 Nvidia GPU 上的 PyTorch、llama.cpp、Ollama、量化 int4 和 GGUF 模型、vLLM、SGLang 以及 FlagOS 支持。

常见用例

  • 多模态助手工作流

    当你需要一个既能回答关于图像、文档页面或其他视觉输入的问题,又能处理语音交互的系统时,可使用该模型。

  • 实时语音助手

    可用于需要实时监听和响应的实时对话代理,包括英语和中文双语语音交互以及可配置语音。

  • 全双工直播

    可用于将摄像头输入和音频与连续输出结合起来的应用,例如演示体验、具身界面或实时场景解说。

  • 文档与 OCR 处理

    当 OCR 或文档解析是工作的一部分时,可使用该模型,尤其适用于高分辨率页面和图像密集型工作流。

  • 本地与优化部署

    当你需要通过 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式进行本地或优化推理时,可使用可部署变体和运行时支持。

Pros and Cons

Pros

  • 将视觉、语音和流式行为整合到一个模型中,而不需要分别使用独立系统。
  • 同时支持 instruct 和 thinking 模式,让用户可以在效率与更深层推理之间进行选择。
  • 提供多种部署选项,包括面向 CPU 的路径、量化路径以及更高吞吐量的运行时。
  • 支持多语言语音和超过 30 种语言,从而拓宽了实际使用场景。
  • 除通用多模态理解外,还包含 OCR 和文档解析能力。

Cons

  • 来源将基础用法描述为在 Nvidia GPU 上进行 PyTorch 推理,因此最直接的设置并不适合所有环境,且不够轻量。
  • 某些能力,例如全双工直播和主动交互,属于专门场景,可能比标准单轮推理需要更复杂的集成。
  • 收集到的定价信息是关于 Hugging Face 通用服务的,而不是 MiniCPM-o 4.5 的模型专属定价。

FAQ

MiniCPM-o 4.5 是什么类型的模型?

MiniCPM-o 4.5 被定位为一款用于视觉、语音和全双工直播的多模态模型。它被呈现为一个支持 instruct 和 thinking 模式的单一模型。

MiniCPM-o 4.5 可以如何运行?

来源说明该模型可使用 Nvidia GPU 上的 PyTorch 推理进行基础使用,也支持用于 CPU 推理的 llama.cpp 和 Ollama,以及用于更高吞吐量推理的量化 int4 和 GGUF 格式、vLLM 和 SGLang,还支持用于统一多芯片后端插件的 FlagOS。

除了文本和图像理解之外,该模型还支持什么?

该模型被描述为支持英语和中文的实时语音对话,以及全双工多模态直播,在此过程中可同时处理视频和音频输入,并并发生成文本和语音输出。

提到了哪些输入类型和语言覆盖范围?

模型卡说明 MiniCPM-o 4.5 可处理最高 180 万像素的高分辨率图像、最高 10 fps 的高帧率视频,并支持超过 30 种语言的多语言能力。

在 Hugging Face 上使用这个模型是否有公开定价?

Hugging Face 的定价页面确认 Hugging Face 提供付费基础设施和推理服务,但收集到的来源没有提供 MiniCPM-o 4.5 的模型专属定价。

Quick Facts

提供方
openbmb
平台
Hugging Face
模型类型
多模态模型
模态
视觉、语音、音频、视频、文本
参数量
9B
来源域名
huggingface.co