MiniCPM5-2B icon

MiniCPM5-2B

MiniCPM5-2B 是一款紧凑型 2B 级因果语言模型,适用于本地助手、编程代理、工具调用、长上下文文本处理和推理任务,支持原生 131,072 个 token 上下文,面向端侧及资源受限部署。

MiniCPM5-2B

概览

MiniCPM5-2B 是 MiniCPM5 系列中的一款 2B 级稠密因果语言模型。它采用标准 LlamaForCausalLM 架构,面向本地助手、编程代理、工具调用工作流以及适合使用紧凑型模型的推理场景。

该模型兼顾了小型部署目标与原生 131,072 个 token 的上下文长度。其发布的对比结果显示,在所述评测集上的平均得分为 53.9,测试涵盖编程、数学、指令遵循、知识、长上下文任务、工具调用和代理工作流。这些结果反映的是作者所使用的对比集,并不保证适用于每个应用。

主要特性

紧凑型 2B 级模型

该模型采用稠密 Transformer 架构,包含 2,516,756,480 个参数,为不需要更大型模型的应用提供了一种紧凑型替代方案。

长上下文支持

131,072 个 token 的原生上下文长度支持长文档、较长对话以及其他大规模文本输入相关的任务。

专注于本地和边缘部署

该模型面向本地助手、端侧部署和资源受限场景,因而将本地运行作为核心目标,而不仅仅是托管式工作流。

广泛的任务覆盖

发布的评测表涵盖代码推理、数学、指令遵循、通识知识、长上下文理解、工具调用和代理任务。

多阶段后训练与开放数据

最终检查点据称经过监督微调、强化学习和 OPD 后训练,同时项目还发布了 UltraData 系列中的相关训练数据集。

多种运行时格式

模型目录提供 BF16、GGUF、MLX/4-bit、GPTQ/4-bit、DSpark 和 LiteRT-LM 变体,以适配不同的部署环境。

使用场景

  • 本地助手

    当应用需要语言交互且不希望默认选择更大型模型时,可将该模型用作本地运行的对话助手。源材料明确将 MiniCPM5-2B 定位于端侧和本地部署。

  • 编程支持与编程代理

    可将其应用于代码推理和编程代理任务等面向编程的工作流。发布结果包括 LiveCodeBench、LCB-Pro、OJBench、SciCode 和软件工程代理评测,但仍需进行针对具体应用的验证。

  • 工具调用工作流

    构建将模型响应与外部工具或结构化操作相结合的工作流。模型卡中的工具调用基准包括 τ³-Bench、τ²-Bench 和 BFCL v4,为这一目标工作流类别提供了依据。

  • 长上下文文本处理

    在单个模型上下文中处理长文档、较长对话或其他大规模文本输入。131,072 个 token 的上下文长度是该场景相关的已发布能力。

  • 紧凑型推理与代理原型

    构建需要覆盖数学、通识知识、搜索和通用代理任务的紧凑型推理或代理系统原型。模型卡报告了这些领域的评测结果,但实际适用性取决于任务和运行时。

Pros and Cons

Pros

  • 面向本地和资源受限部署的紧凑型 2B 级稠密架构。
  • 原生 131,072 个 token 的上下文长度,适用于长文本工作流。
  • 发布的评测涵盖编程、数学、长上下文理解、工具调用和多个代理类别。
  • 提供多种格式,包括 BF16、GGUF、MLX/4-bit、GPTQ/4-bit、DSpark 和 LiteRT-LM。
  • 模型代码仓库元数据中标明采用 Apache-2.0 许可证。

Cons

  • 源材料未提供硬件要求、实测延迟、内存使用情况或完整的设置流程,因此必须针对所选运行时和量化方式验证部署成本。
  • 基准测试结果基于特定的对比集和评测方法报告,不应被视为普遍适用的性能保证。
  • 模型覆盖广泛任务并不意味着可以免除对编程、推理和工具调用应用中的输出进行验证的必要。

FAQ

MiniCPM5-2B 是什么?

MiniCPM5-2B 是一款基于标准 LlamaForCausalLM 架构的因果语言模型。它采用稠密 Transformer 架构,包含 2,516,756,480 个参数、42 层、16 个查询注意力头和 2 个键值头。

MiniCPM5-2B 适用于哪些场景?

该模型适用于本地助手、编程代理、工具调用工作流、推理任务、端侧部署,以及其他倾向于使用紧凑型模型的资源受限场景。

MiniCPM5-2B 支持多长的上下文?

模型卡列出的原生上下文长度为 131,072 个 token,支持长上下文语言任务,以及需要处理相对较大输入的工作流。

有哪些可用的模型格式?

列出的模型变体包括 BF16 最终版本、适用于 llama.cpp、Ollama 和 LM Studio 的 GGUF、适用于 Apple Silicon 的 MLX/4-bit、GPTQ/4-bit、用于加速推理的 DSpark 草稿模型,以及 LiteRT-LM 版本。具体选择取决于目标运行时。

该模型采用什么许可证?

模型卡将许可证标识为 Apache-2.0。在特定项目中部署前,用户仍应查看代码仓库中的许可证及其附带条款。

Quick Facts

类别
因果语言模型
架构
标准 LlamaForCausalLM;稠密 Transformer
参数量
总计 2,516,756,480;非嵌入参数 1,981,982,720
上下文长度
131,072 个 token
注意力机制
42 层;采用 GQA,包含 16 个 Q 头和 2 个 KV 头
许可证
Apache-2.0
MiniCPM5-2B - AI Tool, Features, Use Cases & Alternatives | UStack