基于扩散的推理
Mercury 2 使用基于扩散的生成,而不是从左到右的 token 解码,在较少步骤内并行细化输出。
Mercury 2 是 Inception 速度最快的推理语言模型,基于扩散而非自回归解码构建。它被定位为面向生产的 LLM,适合需要在严格延迟预算内获得推理级质量的团队。
该产品面向那些延迟会在多步骤流程中不断累积的工作流,例如编程助手、Agent 循环、语音界面和检索管道。Inception 表示 Mercury 2 现已可通过其 API 和聊天体验使用,并且兼容 OpenAI API,便于在现有技术栈中更轻松地采用。
Mercury 2 使用基于扩散的生成,而不是从左到右的 token 解码,在较少步骤内并行细化输出。
模型页面将 Mercury 2 描述为在商用 NVIDIA GPU 上可达到每秒 1,000+ tokens,发布文章则引用其在 NVIDIA Blackwell GPU 上达到每秒 1,009 tokens。
该模型被描述为兼容 OpenAI API,可作为现有 LLM 工作流的即插即用替代方案。
Inception 列出了可调推理、128K 上下文窗口、原生工具调用以及面向生产工作流的 schema 对齐 JSON 输出。
发布文章称 Mercury 2 的设计目标是在高并发下保持 p95 延迟、轮次间行为和吞吐量稳定。
Inception 将 Mercury 2 定位为其最强大的模型,适用于对性能和速度都很重要的复杂应用。
对于自动补全、下一步编辑建议、重构和交互式编程 Agent,Mercury 2 的定位是提供足够响应迅速的建议,以保持开发者的工作流顺畅。
对于串联多个推理调用的工作流,例如子 Agent 或活动优化,更低的单次调用延迟会改变实际可运行的步骤数量。
对于语音界面和实时对话系统,Inception 将 Mercury 2 描述为一种让文本生成与自然语音节奏保持一致的方式。
对于多跳检索、重排序和摘要管道,Mercury 2 可以在不让端到端延迟超出实用范围的前提下加入推理能力。
Mercury 2 现已可通过 Inception 的 API 和聊天界面访问。网站还说明它兼容 OpenAI API,因此可以在不重写代码的情况下接入现有技术栈。
Inception 将 Mercury 2 定位于对延迟敏感的工作,例如编程与编辑、Agent 工作流、实时语音与交互,以及搜索或 RAG 管道。
产品页列出了可调推理、128K 上下文窗口、原生工具调用以及与 schema 对齐的 JSON 输出。它还强调了通过扩散式并行细化实现的快速生成。
网站上的定价页不可用,但模型页显示了 Free、Developer 和 Enterprise 三种访问路径。Free 包括对所有模型的访问和 1000 万免费 tokens;Developer 按使用量计费;Enterprise 额外提供自定义速率限制、SLA 保证、安全与隐私以及基于用量的定价。
源材料未列出正式的集成目录。不过资料说明 Mercury 2 兼容 OpenAI API,并可通过 AISuite、LiteLLM 和 LangChain 等库使用。
紫东太初是中科院自动化所和武汉人工智能研究院推出的多模态大模型,支持多轮问答、文本创作、图像生成、3D理解和信号分析,适合图文音、三维与信号数据处理场景。
一个集成图像、视频、语音、写作和聊天工具的全能AI平台,以增强创造力和协作。
Slidesgo 是面向 Google Slides、PowerPoint 和部分 Canva 工作流的演示模板平台,提供免费与 Premium 模板,并支持 AI 辅助制作和团队协作访问。
Wysera 是一款 AI 商务平台,整合内容工具 PostWyse 与 CRM、营收工作流 OpsWyse,并由共享的 Wyse AI 驱动,适合个人、团队和代理商进行审批优先的自动化管理。
Grok 是 xAI 开发的一款免费人工智能助手,旨在优先考虑真实性和客观性,同时提供实时信息访问和图像生成等高级功能。
Creativly 是一款基于网页的 AI 创意工作室,可用简短输入快速生成视觉概念、样机和风格化图片,适合设计师、创作者和创业者进行快速视觉构思。