9B パラメータのマルチモーダルモデル
このモデルは SigLip2、Whisper-medium、CosyVoice2、Qwen3-8B からエンドツーエンドで構成され、合計 9B パラメータを持ち、MiniCPM-o シリーズの最新モデルとして提示されています。
openbmb/MiniCPM-o-4_5 は、Vision・音声・OCR・フルデュプレックスのライブ配信ワークフローに対応する9Bパラメータのマルチモーダルモデルです。英中バイリンガル音声や instruct/thinking、PyTorch・llama.cpp・Ollama・vLLM・SGLang にも対応。
MiniCPM-o 4.5 は、Hugging Face 上の openbmb によるマルチモーダルモデルで、Vision、音声、ライブ配信機能を単一のエンドツーエンドシステムに統合しています。モデルカードでは、SigLip2、Whisper-medium、CosyVoice2、Qwen3-8B をベースにした 9B パラメータの MiniCPM-o シリーズで最新かつ最も高性能なモデルとして説明されています。
ソースでは、このモデルの主な用途として、視覚理解、リアルタイム音声会話、フルデュプレックスのマルチモーダルライブ配信、OCR/文書解析の 4 つが強調されています。また、英語と中国語のバイリンガル音声、全体で 30 以上の言語、さらに Nvidia GPU 上の PyTorch から llama.cpp、Ollama、vLLM、SGLang、量子化形式、FlagOS まで、複数のデプロイ方法に対応していることも示されています。
このモデルは SigLip2、Whisper-medium、CosyVoice2、Qwen3-8B からエンドツーエンドで構成され、合計 9B パラメータを持ち、MiniCPM-o シリーズの最新モデルとして提示されています。
MiniCPM-o 4.5 は 1 つのモデル内で instruct モードと thinking モードの両方をサポートしており、モデルを切り替えることなく、より高速な応答とより深い推論動作を使い分けられます。
このモデルは、英語と中国語でのバイリンガルなリアルタイム音声会話、設定可能なアシスタント音声、ボイスクローニング、短い参照音声クリップからのロールプレイをサポートします。
連続する音声ストリームと映像ストリームを同時に処理しながら、テキストと音声の出力を並行して生成でき、モダリティ間でブロックせずにフルデュプレックスのライブ対話を実現します。
このモデルは最大 180 万ピクセルの高解像度画像と最大 10 fps の高 FPS 動画を扱え、OCR や文書解析タスクに強いと説明されています。
ページには、Nvidia GPU 上の PyTorch、llama.cpp、Ollama、量子化された int4 および GGUF モデル、vLLM、SGLang、FlagOS サポートを含む複数のデプロイ方法が記載されています。
画像、文書ページ、その他の視覚入力に関する質問に答えながら、音声関連のやり取りも処理できる 1 つのシステムが必要な場合に使用します。
設定可能な音声を使った英語と中国語のバイリンガル音声対話を含め、リアルタイムで聞いて応答する必要があるライブ会話エージェントに使用します。
デモ体験、エンボディードインターフェース、ライブシーン解説など、カメラ入力と音声を継続的な出力と組み合わせるアプリケーションに使用します。
OCR や文書解析が業務の一部であり、特に高解像度ページや画像中心のワークフローで必要な場合に使用します。
PyTorch、llama.cpp、Ollama、vLLM、SGLang、または量子化形式を通じてローカルまたは最適化された推論が必要な場合に、デプロイ可能なバリアントとランタイムサポートを使用します。
MiniCPM-o 4.5 は、Vision・音声・フルデュプレックスのライブ配信に対応するマルチモーダルモデルとして位置づけられています。instruct モードと thinking モードの両方をサポートする単一モデルとして提示されています。
ソースによると、このモデルは Nvidia GPU 上での PyTorch 推論による基本的な利用に加え、CPU 推論向けの llama.cpp と Ollama、より高スループットな推論向けの quantized int4 および GGUF 形式、vLLM と SGLang、そして統一されたマルチチップバックエンドプラグインとしての FlagOS に対応しています。
このモデルは、英語と中国語でのリアルタイム音声会話に加え、動画と音声の入力を処理しながらテキストと音声の出力を同時に生成するフルデュプレックスのマルチモーダルライブ配信にも対応していると説明されています。
モデルカードでは、MiniCPM-o 4.5 は最大 180 万ピクセルの高解像度画像、最大 10 fps の高 FPS 動画を処理でき、30 以上の言語にわたる多言語機能をサポートするとされています。
Hugging Face の価格ページでは、Hugging Face が有料のインフラと推論サービスを提供していることは確認できますが、収集されたソースには MiniCPM-o 4.5 のモデル固有の価格情報は記載されていません。
BookAIは、書名と著者を提供するだけで、AIを使って本とチャットできるサービスです。
Lassoは、カタログ情報の拡充、仕入先ファイルの処理、商品コンテンツの生成、競合監視に使えるecommerce商品データプラットフォームです。REST API、SDK、MCP serverも搭載。
Ably Chatは、カスタムのリアルタイムチャットアプリを構築できるチャットAPIプラットフォームです。ルーム単位のメッセージ、入力中表示、プレゼンス、リアクション、メッセージ更新に対応し、利用量ベースの料金も選べます。
Botactsは、電話、メール、SMS、WhatsApp、Telegram、Signalで連絡できるAI bot・agentを探せるWebディレクトリです。公開前の手動審査にも対応。
Tavusは、リアルタイムの対面AIエージェント、デジタルツイン、AIコンパニオンを構築できるAI動画プラットフォーム。API、カスタム複製、多言語会話ワークフローに対応します。
HiringPartner.aiは、候補者のソーシング、スクリーニング、面接を24時間自動化するAI採用プラットフォーム。ATS連携、履歴書一括アップロード、確認可能な面接結果に対応。