openbmb/MiniCPM-o-4_5 icon

openbmb/MiniCPM-o-4_5

openbmb/MiniCPM-o-4_5 は、Vision・音声・OCR・フルデュプレックスのライブ配信ワークフローに対応する9Bパラメータのマルチモーダルモデルです。英中バイリンガル音声や instruct/thinking、PyTorch・llama.cpp・Ollama・vLLM・SGLang にも対応。

openbmb/MiniCPM-o-4_5

概要

MiniCPM-o 4.5 は、Hugging Face 上の openbmb によるマルチモーダルモデルで、Vision、音声、ライブ配信機能を単一のエンドツーエンドシステムに統合しています。モデルカードでは、SigLip2、Whisper-medium、CosyVoice2、Qwen3-8B をベースにした 9B パラメータの MiniCPM-o シリーズで最新かつ最も高性能なモデルとして説明されています。

ソースでは、このモデルの主な用途として、視覚理解、リアルタイム音声会話、フルデュプレックスのマルチモーダルライブ配信、OCR/文書解析の 4 つが強調されています。また、英語と中国語のバイリンガル音声、全体で 30 以上の言語、さらに Nvidia GPU 上の PyTorch から llama.cpp、Ollama、vLLM、SGLang、量子化形式、FlagOS まで、複数のデプロイ方法に対応していることも示されています。

主な機能

9B パラメータのマルチモーダルモデル

このモデルは SigLip2、Whisper-medium、CosyVoice2、Qwen3-8B からエンドツーエンドで構成され、合計 9B パラメータを持ち、MiniCPM-o シリーズの最新モデルとして提示されています。

Instruct と thinking モード

MiniCPM-o 4.5 は 1 つのモデル内で instruct モードと thinking モードの両方をサポートしており、モデルを切り替えることなく、より高速な応答とより深い推論動作を使い分けられます。

音声会話機能

このモデルは、英語と中国語でのバイリンガルなリアルタイム音声会話、設定可能なアシスタント音声、ボイスクローニング、短い参照音声クリップからのロールプレイをサポートします。

フルデュプレックスのライブ配信

連続する音声ストリームと映像ストリームを同時に処理しながら、テキストと音声の出力を並行して生成でき、モダリティ間でブロックせずにフルデュプレックスのライブ対話を実現します。

高解像度の視覚入力

このモデルは最大 180 万ピクセルの高解像度画像と最大 10 fps の高 FPS 動画を扱え、OCR や文書解析タスクに強いと説明されています。

複数の推論・デプロイオプション

ページには、Nvidia GPU 上の PyTorch、llama.cpp、Ollama、量子化された int4 および GGUF モデル、vLLM、SGLang、FlagOS サポートを含む複数のデプロイ方法が記載されています。

一般的なユースケース

  • マルチモーダルアシスタントのワークフロー

    画像、文書ページ、その他の視覚入力に関する質問に答えながら、音声関連のやり取りも処理できる 1 つのシステムが必要な場合に使用します。

  • リアルタイム音声アシスタント

    設定可能な音声を使った英語と中国語のバイリンガル音声対話を含め、リアルタイムで聞いて応答する必要があるライブ会話エージェントに使用します。

  • フルデュプレックスのライブ配信

    デモ体験、エンボディードインターフェース、ライブシーン解説など、カメラ入力と音声を継続的な出力と組み合わせるアプリケーションに使用します。

  • 文書・OCR 処理

    OCR や文書解析が業務の一部であり、特に高解像度ページや画像中心のワークフローで必要な場合に使用します。

  • ローカルおよび最適化デプロイ

    PyTorch、llama.cpp、Ollama、vLLM、SGLang、または量子化形式を通じてローカルまたは最適化された推論が必要な場合に、デプロイ可能なバリアントとランタイムサポートを使用します。

Pros and Cons

Pros

  • Vision、音声、ストリーミング動作を 1 つのモデルにまとめており、別々のシステムを必要としません。
  • instruct モードと thinking モードの両方をサポートしているため、効率性とより深い推論のどちらを重視するかを選べます。
  • CPU 向けや量子化された経路に加え、より高スループットなランタイムも含む複数のデプロイオプションを提供しています。
  • 多言語音声と 30 以上の言語をサポートしており、実用的なユースケースが広がります。
  • 一般的なマルチモーダル理解に加えて、OCR と文書解析機能も備えています。

Cons

  • ソースでは基本的な利用方法として Nvidia GPU 上の PyTorch 推論が説明されているため、最も直接的なセットアップはすべての環境で軽量とは言えません。
  • フルデュプレックスのライブ配信やプロアクティブな対話など、一部の機能は専門的であり、標準的な単一ターン推論よりも複雑な統合が必要になる場合があります。
  • 収集された価格情報は Hugging Face のサービス全般に関するものであり、MiniCPM-o 4.5 のモデル固有の価格ではありません。

FAQ

MiniCPM-o 4.5 はどのようなモデルですか?

MiniCPM-o 4.5 は、Vision・音声・フルデュプレックスのライブ配信に対応するマルチモーダルモデルとして位置づけられています。instruct モードと thinking モードの両方をサポートする単一モデルとして提示されています。

MiniCPM-o 4.5 はどのように実行できますか?

ソースによると、このモデルは Nvidia GPU 上での PyTorch 推論による基本的な利用に加え、CPU 推論向けの llama.cpp と Ollama、より高スループットな推論向けの quantized int4 および GGUF 形式、vLLM と SGLang、そして統一されたマルチチップバックエンドプラグインとしての FlagOS に対応しています。

テキストと画像理解以外に、どのような機能をサポートしていますか?

このモデルは、英語と中国語でのリアルタイム音声会話に加え、動画と音声の入力を処理しながらテキストと音声の出力を同時に生成するフルデュプレックスのマルチモーダルライブ配信にも対応していると説明されています。

どのような入力タイプと言語対応が記載されていますか?

モデルカードでは、MiniCPM-o 4.5 は最大 180 万ピクセルの高解像度画像、最大 10 fps の高 FPS 動画を処理でき、30 以上の言語にわたる多言語機能をサポートするとされています。

このモデルを Hugging Face で利用する公開価格はありますか?

Hugging Face の価格ページでは、Hugging Face が有料のインフラと推論サービスを提供していることは確認できますが、収集されたソースには MiniCPM-o 4.5 のモデル固有の価格情報は記載されていません。

Quick Facts

提供元
openbmb
プラットフォーム
Hugging Face
モデルタイプ
マルチモーダルモデル
モダリティ
Vision、音声、音声、動画、テキスト
パラメータ数
9B
ソースドメイン
huggingface.co