RunInfra icon

RunInfra

RunInfra 通过基准测试 GPU、调优受支持的运行时路径,并可部署托管 API 或导出自托管堆栈,帮助团队将开源模型转化为生产推理栈。

RunInfra

概述

RunInfra 是一个用于将开源模型转化为生产推理栈的平台。你只需描述工作负载,服务就会对 GPU 进行基准测试、比较兼容的服务引擎、调优受支持的运行时路径,并生成一个托管 API 或一个可导出的堆栈,供你的团队检查和拥有。

网站展示了该产品用于模型服务、延迟和成本检查、GPU 选择以及跨聊天、语音、嵌入和检索等工作负载的部署规划。定价采用积分制:Core 是自助式月度计划,而 Enterprise 则增加了专用基础设施、合规、自定义用量,以及对自托管或自定义 GPU 部署的支持。

核心能力

对 GPU 和引擎选项进行基准测试

RunInfra 会针对已描述的工作负载比较服务引擎和 GPU 目标,然后在选择路径之前对候选项进行基准测试。网站展示了引擎、GPU 类型、p95 延迟、吞吐量、VRAM 和成本方面的对比。

为模型调优运行时路径

产品会在受支持的情况下应用优化步骤,包括量化、内核调优、KV cache 重用、推测解码、前缀缓存、FlashAttention v2,以及与批处理相关的服务设置。首页将这些内容展示为调优工作流的一部分,而不是用户必须手动编写的配置。

生成可检查的结果

一次运行结束后会生成可检查的基准测试收据和部署套件。网站说明该堆栈不会被隐藏,并且可以在部署前被复现或修改。

支持托管部署和导出

RunInfra 可以部署生产 API 端点,也可以导出堆栈用于自托管。首页展示了托管端点、可导出的 Docker 和部署文件,以及在 RunInfra、RunPod 和 Modal 上部署的示例。

覆盖完整的优化工作流

定价页列出了 Core 中的 OpenAI 兼容 API 端点、agent chat、plans、基准测试、无限 pipelines 和版本控制。这表明该工作流在一个系统中涵盖规划、测试和服务。

添加企业级控制和私有基础设施

Enterprise 增加了自托管和自定义 GPU 部署、审计日志、RBAC、专属支持,以及对 B200/H200 GPU 的访问。安全页面还补充了加密、日志记录和事件响应等文档化控制。

RunInfra 的常见用法

  • 为新模型选择服务配置

    使用 RunInfra 选择模型、比较 GPU 候选项,并在部署前验证延迟、吞吐量、VRAM 和成本。这适合希望基于证据做出服务选择,而不是默认选定 GPU 的团队。

  • 针对延迟或成本优化工作负载

    描述一个聊天、语音、嵌入或检索工作负载,让平台生成优化后的服务路径。首页展示了 Qwen、Whisper 和 BGE 风格工作负载的示例。

  • 从托管推理迁移到自托管部署

    当你希望服务来托管堆栈时,可先使用托管端点;如果之后需要在自己的环境中运行,再导出相同的运行时套件。网站展示了在 RunInfra、RunPod 和 Modal 上的部署,以及可下载的堆栈文件。

  • 满足企业采购和安全要求

    需要私有基础设施、审计日志、RBAC 和已记录安全态势的企业团队,可以使用 Enterprise 计划而不是 Core。安全页和定价页描述了这些控制和支持安排。

  • 跟踪并审查优化运行

    希望获得可复现基准结果记录的团队,可以使用收据和版本化流水线工作流。定价页提到无限 pipelines 和版本控制,首页展示了带有前后指标的基准测试收据。

Pros and Cons

Pros

  • 将基准测试、调优和部署整合到一个工作流中。
  • 通过延迟、吞吐量、VRAM 和成本等可测量输出展示所选堆栈。
  • 同时支持托管端点和可导出的部署工件。
  • Core 计划采用积分模式,没有按席位收费。
  • 为私有基础设施、合规和支持提供企业选项。

Cons

  • 公开网站对集成、支持的云以及某些工作流限制只提供了部分说明。
  • 自托管部署、自定义 GPU、RBAC 和审计日志等高级控制仅属于 Enterprise,而非 Core 计划。
  • 主页和定价页没有公布完整的限制表或全部支持的部署目标列表。

FAQ

RunInfra 是做什么的?

RunInfra 会接收你描述的推理工作负载,匹配兼容的开源模型,基准测试 GPU 选项,并生成部署路径或可导出的堆栈。输出可以作为托管端点使用,或带到其他环境进行自托管。

RunInfra 如何收费?

定价页显示,Core 是自助式月度积分计划,Enterprise 则提供专用基础设施、合规、自定义积分额度和合同条款。Core 包含用于优化、部署和 agent 的共享积分余额。

支持哪些模型和引擎?

主页和定价页显示,它支持开源模型以及常见的服务引擎,如 vLLM 和 SGLang,并支持 OpenAI 兼容的 API 端点。网站还展示了 Llama、Qwen、Mistral、Whisper、Gemma、DeepSeek 等模型系列。

我可以导出或自托管这个堆栈吗?

该产品可以在 RunInfra 上部署托管端点,或导出可运行的堆栈,包括 Dockerfile、compose.yaml、k8s/deployment.yaml、serve.py、benchmark.md 和 runinfra.yaml 等文件。网站还显示了在你自己的 RunPod 账户或 Modal workspace 上部署的选项。

RunInfra 适合注重安全的团队吗?

RunInfra 的安全页面说明,该服务通过了 SOC 2 Type II 鉴证,传输中使用 TLS,主数据库和对象存储静态数据使用 AES-256 加密,并提供基于角色的访问控制。Enterprise 在定价页中包含审计日志和 RBAC。

Quick Facts

类别
AI 基础设施
主要用途
优化并部署开源模型推理栈
定价模式
基于积分的 Core 计划加 Enterprise 合同定价
部署
托管 API 端点或可导出的堆栈
官网
runinfra.ai
安全性
已通过 SOC 2 Type II 鉴证;已记录加密和 RBAC