9B 參數多模態模型
這個模型由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 組成端到端架構,總參數量為 9B,並被介紹為 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的多模態模型,將視覺、語音與直播能力整合到單一端到端系統中。模型卡將其描述為 MiniCPM-o 系列中最新且能力最強的模型,並由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 構成,總參數量為 9B。
來源強調了此模型的四項主要任務:視覺理解、即時語音對話、全雙工多模態直播,以及 OCR/文件解析。它也指出,該模型支援英文與中文雙語語音、整體超過 30 種語言,並提供多種部署路徑,從 Nvidia GPU 上的 PyTorch 到 llama.cpp、Ollama、vLLM、SGLang、量化格式與 FlagOS。
這個模型由 SigLip2、Whisper-medium、CosyVoice2 與 Qwen3-8B 組成端到端架構,總參數量為 9B,並被介紹為 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 在單一模型中同時支援 instruct 與 thinking 模式,讓使用者可在較快回應與更深入推理行為之間切換,而不必更換模型。
這個模型支援英文與中文的即時雙語語音對話、可設定的助理聲線、聲音複製,以及從一段簡短參考音訊中進行角色扮演。
它可以同時處理連續的音訊與影片串流,並同時生成文字與語音輸出,實現不受模態阻塞的全雙工即時互動。
這個模型可處理最高 180 萬像素的高解析度影像與最高 10 fps 的高幀率影片,並被描述為在 OCR 與文件解析任務上表現出色。
頁面列出多種部署路徑,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 與 GGUF 模型、vLLM、SGLang,以及 FlagOS 支援。
當你需要一個能回答影像、文件頁面或其他視覺輸入問題,同時也能處理語音互動的單一系統時,可使用此模型。
可用於需要即時聆聽與回應的即時對話代理,包括支援英文與中文雙語語音互動且可設定聲線的情境。
可用於結合攝影機輸入與音訊、並持續輸出內容的應用,例如展示體驗、具身介面或即時場景解說。
當 OCR 或文件解析是工作的一部分時可使用,特別適合高解析度頁面與以影像為主的工作流程。
當你需要透過 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式進行本地或最佳化推論時,可使用可部署變體與執行階段支援。
MiniCPM-o 4.5 被定位為一個用於視覺、語音與全雙工直播的多模態模型。它被呈現為單一模型,同時支援 instruct 與 thinking 模式。
來源指出,這個模型可在 Nvidia GPU 上使用 PyTorch 推論進行基本使用,也支援 llama.cpp 與 Ollama 進行 CPU 推論、量化 int4 與 GGUF 格式、vLLM 與 SGLang 進行更高吞吐量推論,以及 FlagOS 作為統一的多晶片後端外掛。
這個模型被描述為支援英文與中文的即時語音對話,以及全雙工多模態直播,可在生成文字與語音輸出的同時處理影片與音訊輸入。
模型卡表示,MiniCPM-o 4.5 可處理最高 180 萬像素的高解析度影像、最高 10 fps 的高幀率影片,並支援超過 30 種語言的多語能力。
Hugging Face 的定價頁面確認 Hugging Face 提供付費基礎設施與推論服務,但彙整來源未提供 MiniCPM-o 4.5 的模型專屬定價。
BookAI允許您透過簡單提供書名和作者與您的書籍進行AI聊天。
Lasso 是一站式 ecommerce 商品資料平台,協助補強目錄資料、處理供應商檔案、產生商品內容與監控競品,並提供 Web App、REST API、SDK 與 MCP server。
Ably Chat 是一個聊天 API 平台,適合打造自訂即時聊天應用程式。支援聊天室訊息、輸入中提示、在線狀態、表情回應與訊息更新,並提供依使用量計費選項。
Botacts 是一個 AI 機器人與代理目錄,可依電話、Email、SMS、WhatsApp、Telegram 或 Signal 聯絡。也提供提交新機器人供人工審核後上架。
Tavus 是一個 AI 影片平台,協助開發即時面對面代理、數位分身與 AI 陪伴。提供 API、客製化複製體與多語言對話工作流程,適合開發者與團隊。
HiringPartner.ai 是可自動運作的 AI 招募平台,支援 24/7 人才搜羅、篩選與面試,整合 ATS 流程、批量履歷上傳,並提供可供審閱的面試結果。