openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

openbmb/MiniCPM-o-4_5 是 Hugging Face 上的 9B 多模態模型,支援視覺、語音、OCR 與全雙工直播流程,並提供 instruct、thinking、PyTorch、llama.cpp、Ollama、vLLM、SGLang。

openbmb/MiniCPM-o-4_5

概覽

MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的多模態模型,將視覺、語音與直播能力整合到單一端到端系統中。模型卡將其描述為 MiniCPM-o 系列中最新且能力最強的模型,並由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 構成,總參數量為 9B。

來源強調了此模型的四項主要任務:視覺理解、即時語音對話、全雙工多模態直播,以及 OCR/文件解析。它也指出,該模型支援英文與中文雙語語音、整體超過 30 種語言,並提供多種部署路徑,從 Nvidia GPU 上的 PyTorch 到 llama.cpp、Ollama、vLLM、SGLang、量化格式與 FlagOS。

主要功能

9B 參數多模態模型

這個模型由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 組成端到端架構,總參數量為 9B,並被介紹為 MiniCPM-o 系列中的最新模型。

instruct 與 thinking 模式

MiniCPM-o 4.5 在單一模型中同時支援 instruct 與 thinking 模式,讓使用者可在較快回應與更深入推理行為之間切換,而不必更換模型。

語音對話功能

這個模型支援英文與中文的即時雙語語音對話、可設定的助理聲線、聲音複製,以及從一段簡短參考音訊中進行角色扮演。

全雙工直播

它可以同時處理連續的音訊與影片串流,並同時生成文字與語音輸出,實現不受模態阻塞的全雙工即時互動。

高解析度視覺輸入

這個模型可處理最高 180 萬像素的高解析度影像與最高 10 fps 的高幀率影片,並被描述為在 OCR 與文件解析任務上表現出色。

多種推論與部署選項

頁面列出多種部署路徑,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 與 GGUF 模型、vLLM、SGLang,以及 FlagOS 支援。

常見使用情境

  • 多模態助理流程

    當你需要一個能回答影像、文件頁面或其他視覺輸入問題,同時也能處理語音互動的單一系統時,可使用此模型。

  • 即時語音助理

    可用於需要即時聆聽與回應的即時對話代理,包括支援英文與中文雙語語音互動且可設定聲線的情境。

  • 全雙工直播

    可用於結合攝影機輸入與音訊、並持續輸出內容的應用,例如展示體驗、具身介面或即時場景解說。

  • 文件與 OCR 處理

    當 OCR 或文件解析是工作的一部分時可使用,特別適合高解析度頁面與以影像為主的工作流程。

  • 本地與最佳化部署

    當你需要透過 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式進行本地或最佳化推論時,可使用可部署變體與執行階段支援。

Pros and Cons

Pros

  • 將視覺、語音與串流行為整合於同一模型中,而不需要分開的系統。
  • 同時支援 instruct 與 thinking 模式,讓使用者可在效率與更深入推理之間做選擇。
  • 提供多種部署選項,包括偏向 CPU 的路徑與量化路徑,以及較高吞吐量的執行環境。
  • 支援多語言語音與超過 30 種語言,拓展了實際應用場景。
  • 除了通用多模態理解之外,還包含 OCR 與文件解析能力。

Cons

  • 來源將基本用法描述為在 Nvidia GPU 上進行 PyTorch 推論,因此最直接的設定對所有環境來說並不輕量。
  • 某些能力,例如全雙工直播與主動式互動,屬於專門功能,與標準單輪推論相比可能需要更複雜的整合。
  • 彙整的定價資訊是關於 Hugging Face 服務的一般內容,而非 MiniCPM-o 4.5 的模型專屬定價。

FAQ

MiniCPM-o 4.5 是什麼類型的模型?

MiniCPM-o 4.5 被定位為一個用於視覺、語音與全雙工直播的多模態模型。它被呈現為單一模型,同時支援 instruct 與 thinking 模式。

MiniCPM-o 4.5 可以如何執行?

來源指出,這個模型可在 Nvidia GPU 上使用 PyTorch 推論進行基本使用,也支援 llama.cpp 與 Ollama 進行 CPU 推論、量化 int4 與 GGUF 格式、vLLM 與 SGLang 進行更高吞吐量推論,以及 FlagOS 作為統一的多晶片後端外掛。

除了文字與影像理解之外,這個模型還支援什麼?

這個模型被描述為支援英文與中文的即時語音對話,以及全雙工多模態直播,可在生成文字與語音輸出的同時處理影片與音訊輸入。

提到了哪些輸入類型與語言覆蓋範圍?

模型卡表示,MiniCPM-o 4.5 可處理最高 180 萬像素的高解析度影像、最高 10 fps 的高幀率影片,並支援超過 30 種語言的多語能力。

在 Hugging Face 上使用這個模型有公開定價嗎?

Hugging Face 的定價頁面確認 Hugging Face 提供付費基礎設施與推論服務,但彙整來源未提供 MiniCPM-o 4.5 的模型專屬定價。

Quick Facts

提供者
openbmb
平台
Hugging Face
模型類型
多模態模型
模態
視覺、語音、音訊、影片、文字
參數量
9B
來源網域
huggingface.co