Mercury 2 icon

Mercury 2

Mercury 2 是 Inception 面向生产级 AI 工作流的扩散式推理语言模型,支持低延迟、OpenAI API 兼容性和结构化输出,适用于编程、Agent、语音与检索场景。

Mercury 2

Mercury 2 是什么

Mercury 2 是 Inception 速度最快的推理语言模型,基于扩散而非自回归解码构建。它被定位为面向生产的 LLM,适合需要在严格延迟预算内获得推理级质量的团队。

该产品面向那些延迟会在多步骤流程中不断累积的工作流,例如编程助手、Agent 循环、语音界面和检索管道。Inception 表示 Mercury 2 现已可通过其 API 和聊天体验使用,并且兼容 OpenAI API,便于在现有技术栈中更轻松地采用。

核心能力

基于扩散的推理

Mercury 2 使用基于扩散的生成,而不是从左到右的 token 解码,在较少步骤内并行细化输出。

高吞吐生成

模型页面将 Mercury 2 描述为在商用 NVIDIA GPU 上可达到每秒 1,000+ tokens,发布文章则引用其在 NVIDIA Blackwell GPU 上达到每秒 1,009 tokens。

即插即用的 API 兼容性

该模型被描述为兼容 OpenAI API,可作为现有 LLM 工作流的即插即用替代方案。

面向生产的输出控制

Inception 列出了可调推理、128K 上下文窗口、原生工具调用以及面向生产工作流的 schema 对齐 JSON 输出。

低延迟优先设计

发布文章称 Mercury 2 的设计目标是在高并发下保持 p95 延迟、轮次间行为和吞吐量稳定。

通用推理模型

Inception 将 Mercury 2 定位为其最强大的模型,适用于对性能和速度都很重要的复杂应用。

Mercury 2 的适用场景

  • 编程与编辑

    对于自动补全、下一步编辑建议、重构和交互式编程 Agent,Mercury 2 的定位是提供足够响应迅速的建议,以保持开发者的工作流顺畅。

  • Agent 循环

    对于串联多个推理调用的工作流,例如子 Agent 或活动优化,更低的单次调用延迟会改变实际可运行的步骤数量。

  • 实时语音与交互

    对于语音界面和实时对话系统,Inception 将 Mercury 2 描述为一种让文本生成与自然语音节奏保持一致的方式。

  • 搜索与 RAG 管道

    对于多跳检索、重排序和摘要管道,Mercury 2 可以在不让端到端延迟超出实用范围的前提下加入推理能力。

Pros and Cons

Pros

  • 专为实时或近实时应用设计,适合延迟在每一步都很重要的场景。
  • 采用基于扩散的生成,以并行方式而非顺序解码生成多个 token。
  • 支持可调推理、工具调用、结构化 JSON 输出和 128K 上下文窗口。
  • 被描述为兼容 OpenAI API,可减少现有团队的迁移工作量。
  • 文档化用例覆盖编程、Agent、语音和搜索工作流。

Cons

  • 公开定价页面不可用,因此除网站定价引用之外的套餐细节未在来源页面中完整说明。
  • 源材料未提供正式的集成目录或部署矩阵。

FAQ

团队如何访问 Mercury 2?

Mercury 2 现已可通过 Inception 的 API 和聊天界面访问。网站还说明它兼容 OpenAI API,因此可以在不重写代码的情况下接入现有技术栈。

Mercury 2 最适合用于什么场景?

Inception 将 Mercury 2 定位于对延迟敏感的工作,例如编程与编辑、Agent 工作流、实时语音与交互,以及搜索或 RAG 管道。

产品页描述了哪些能力?

产品页列出了可调推理、128K 上下文窗口、原生工具调用以及与 schema 对齐的 JSON 输出。它还强调了通过扩散式并行细化实现的快速生成。

网站上展示了哪些定价选项?

网站上的定价页不可用,但模型页显示了 Free、Developer 和 Enterprise 三种访问路径。Free 包括对所有模型的访问和 1000 万免费 tokens;Developer 按使用量计费;Enterprise 额外提供自定义速率限制、SLA 保证、安全与隐私以及基于用量的定价。

记录了哪些集成?

源材料未列出正式的集成目录。不过资料说明 Mercury 2 兼容 OpenAI API,并可通过 AISuite、LiteLLM 和 LangChain 等库使用。

Quick Facts

Category
AI 模型 / 开发者工具
Product
Mercury 2
Company
Inception
Platform
API 和聊天
Compatibility
兼容 OpenAI API
Context window
128K