对 GPU 和引擎选项进行基准测试
RunInfra 会针对已描述的工作负载比较服务引擎和 GPU 目标,然后在选择路径之前对候选项进行基准测试。网站展示了引擎、GPU 类型、p95 延迟、吞吐量、VRAM 和成本方面的对比。
RunInfra 通过基准测试 GPU、调优受支持的运行时路径,并可部署托管 API 或导出自托管堆栈,帮助团队将开源模型转化为生产推理栈。
RunInfra 是一个用于将开源模型转化为生产推理栈的平台。你只需描述工作负载,服务就会对 GPU 进行基准测试、比较兼容的服务引擎、调优受支持的运行时路径,并生成一个托管 API 或一个可导出的堆栈,供你的团队检查和拥有。
网站展示了该产品用于模型服务、延迟和成本检查、GPU 选择以及跨聊天、语音、嵌入和检索等工作负载的部署规划。定价采用积分制:Core 是自助式月度计划,而 Enterprise 则增加了专用基础设施、合规、自定义用量,以及对自托管或自定义 GPU 部署的支持。
RunInfra 会针对已描述的工作负载比较服务引擎和 GPU 目标,然后在选择路径之前对候选项进行基准测试。网站展示了引擎、GPU 类型、p95 延迟、吞吐量、VRAM 和成本方面的对比。
产品会在受支持的情况下应用优化步骤,包括量化、内核调优、KV cache 重用、推测解码、前缀缓存、FlashAttention v2,以及与批处理相关的服务设置。首页将这些内容展示为调优工作流的一部分,而不是用户必须手动编写的配置。
一次运行结束后会生成可检查的基准测试收据和部署套件。网站说明该堆栈不会被隐藏,并且可以在部署前被复现或修改。
RunInfra 可以部署生产 API 端点,也可以导出堆栈用于自托管。首页展示了托管端点、可导出的 Docker 和部署文件,以及在 RunInfra、RunPod 和 Modal 上部署的示例。
定价页列出了 Core 中的 OpenAI 兼容 API 端点、agent chat、plans、基准测试、无限 pipelines 和版本控制。这表明该工作流在一个系统中涵盖规划、测试和服务。
Enterprise 增加了自托管和自定义 GPU 部署、审计日志、RBAC、专属支持,以及对 B200/H200 GPU 的访问。安全页面还补充了加密、日志记录和事件响应等文档化控制。
使用 RunInfra 选择模型、比较 GPU 候选项,并在部署前验证延迟、吞吐量、VRAM 和成本。这适合希望基于证据做出服务选择,而不是默认选定 GPU 的团队。
描述一个聊天、语音、嵌入或检索工作负载,让平台生成优化后的服务路径。首页展示了 Qwen、Whisper 和 BGE 风格工作负载的示例。
当你希望服务来托管堆栈时,可先使用托管端点;如果之后需要在自己的环境中运行,再导出相同的运行时套件。网站展示了在 RunInfra、RunPod 和 Modal 上的部署,以及可下载的堆栈文件。
需要私有基础设施、审计日志、RBAC 和已记录安全态势的企业团队,可以使用 Enterprise 计划而不是 Core。安全页和定价页描述了这些控制和支持安排。
希望获得可复现基准结果记录的团队,可以使用收据和版本化流水线工作流。定价页提到无限 pipelines 和版本控制,首页展示了带有前后指标的基准测试收据。
RunInfra 会接收你描述的推理工作负载,匹配兼容的开源模型,基准测试 GPU 选项,并生成部署路径或可导出的堆栈。输出可以作为托管端点使用,或带到其他环境进行自托管。
定价页显示,Core 是自助式月度积分计划,Enterprise 则提供专用基础设施、合规、自定义积分额度和合同条款。Core 包含用于优化、部署和 agent 的共享积分余额。
主页和定价页显示,它支持开源模型以及常见的服务引擎,如 vLLM 和 SGLang,并支持 OpenAI 兼容的 API 端点。网站还展示了 Llama、Qwen、Mistral、Whisper、Gemma、DeepSeek 等模型系列。
该产品可以在 RunInfra 上部署托管端点,或导出可运行的堆栈,包括 Dockerfile、compose.yaml、k8s/deployment.yaml、serve.py、benchmark.md 和 runinfra.yaml 等文件。网站还显示了在你自己的 RunPod 账户或 Modal workspace 上部署的选项。
RunInfra 的安全页面说明,该服务通过了 SOC 2 Type II 鉴证,传输中使用 TLS,主数据库和对象存储静态数据使用 AES-256 加密,并提供基于角色的访问控制。Enterprise 在定价页中包含审计日志和 RBAC。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。
Skills Janitor 是一组托管于 GitHub 的斜杠命令,用于审计、跟踪和管理 Claude Code 与 OpenAI Codex skills。可查找重复项、损坏链接和未使用的 skills,并用独立命令清理。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Ably Chat 是用于构建自定义实时聊天应用的 chat API 平台,支持房间消息、输入指示、在线状态、表情回应与消息更新,并提供按使用量计费选项。