9B 参数多模态模型
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总参数量为 9B,并被介绍为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上发布的一款多模态模型,将视觉、语音和直播能力整合到一个端到端系统中。模型卡将其描述为 MiniCPM-o 系列中最新、能力最强的模型,由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 构建,参数量为 9B。
来源突出说明了该模型的四项主要任务:视觉理解、实时语音对话、全双工多模态直播以及 OCR/文档解析。它还指出,该模型支持英语和中文双语语音、总体超过 30 种语言,以及多种部署路径,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、vLLM、SGLang、量化格式和 FlagOS。
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总参数量为 9B,并被介绍为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 在单一模型中同时支持 instruct 和 thinking 模式,用户可以在更快响应和更深入推理之间进行选择,而无需切换模型。
该模型支持英语和中文的双语实时语音对话,可配置助手声音、声音克隆,以及基于一段简短参考音频的角色扮演。
它可以在生成文本和语音输出的同时处理连续音频和视频流,实现不受模态之间阻塞影响的全双工直播交互。
该模型可处理高达 180 万像素的高分辨率图像和最高 10 fps 的高帧率视频,并且在 OCR 和文档解析任务上表现较强。
页面列出了多种部署路径,包括 Nvidia GPU 上的 PyTorch、llama.cpp、Ollama、量化 int4 和 GGUF 模型、vLLM、SGLang 以及 FlagOS 支持。
当你需要一个既能回答关于图像、文档页面或其他视觉输入的问题,又能处理语音交互的系统时,可使用该模型。
可用于需要实时监听和响应的实时对话代理,包括英语和中文双语语音交互以及可配置语音。
可用于将摄像头输入和音频与连续输出结合起来的应用,例如演示体验、具身界面或实时场景解说。
当 OCR 或文档解析是工作的一部分时,可使用该模型,尤其适用于高分辨率页面和图像密集型工作流。
当你需要通过 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式进行本地或优化推理时,可使用可部署变体和运行时支持。
MiniCPM-o 4.5 被定位为一款用于视觉、语音和全双工直播的多模态模型。它被呈现为一个支持 instruct 和 thinking 模式的单一模型。
来源说明该模型可使用 Nvidia GPU 上的 PyTorch 推理进行基础使用,也支持用于 CPU 推理的 llama.cpp 和 Ollama,以及用于更高吞吐量推理的量化 int4 和 GGUF 格式、vLLM 和 SGLang,还支持用于统一多芯片后端插件的 FlagOS。
该模型被描述为支持英语和中文的实时语音对话,以及全双工多模态直播,在此过程中可同时处理视频和音频输入,并并发生成文本和语音输出。
模型卡说明 MiniCPM-o 4.5 可处理最高 180 万像素的高分辨率图像、最高 10 fps 的高帧率视频,并支持超过 30 种语言的多语言能力。
Hugging Face 的定价页面确认 Hugging Face 提供付费基础设施和推理服务,但收集到的来源没有提供 MiniCPM-o 4.5 的模型专属定价。
BookAI允许您通过简单提供书名和作者与您的书籍进行AI聊天。
Lasso 是一站式电商产品数据平台,用于丰富目录记录、处理供应商文件、生成产品内容并监控竞品,提供 Web 应用、REST API、SDK 和 MCP server,适合团队与开发者。
Ably Chat 是用于构建自定义实时聊天应用的 chat API 平台,支持房间消息、输入指示、在线状态、表情回应与消息更新,并提供按使用量计费选项。
Botacts 是一个 AI 机器人和代理目录,可通过电话、邮箱、短信、WhatsApp、Telegram 或 Signal 联系。还支持提交新机器人并在发布前人工审核。
Tavus 是一款 AI 视频平台,帮助开发者和团队构建实时面对面代理、数字分身和 AI 伴侣,支持 API、自定义复制体与多语言对话工作流。
HiringPartner.ai 是一款自主 AI 招聘平台,支持全天候候选人搜寻、筛选和面试;兼容 ATS 工作流,支持批量简历上传,并提供可复核的面试结果,助力招聘团队高效决策。