RunInfra icon

RunInfra

RunInfra 協助團隊將開源模型轉為可上線的推理堆疊,透過 GPU 基準測試、調校支援的執行路徑,並可部署託管 API 或匯出供自架。

RunInfra

概覽

RunInfra 是一個可將開源模型轉為生產環境推理堆疊的平台。您描述工作負載後,服務會對 GPU 進行基準測試、比較相容的 serving 引擎、調校支援的執行路徑,並產出託管 API 或可匯出的堆疊,供團隊檢視與掌握。

網站展示此產品可用於模型 serving、延遲與成本檢查、GPU 選擇,以及跨 chat、speech、embeddings 和 retrieval 等工作負載的部署規劃。定價採點數制:Core 為自助式月費方案,而 Enterprise 則提供專用基礎架構、合規、自訂用量,以及對自架或自訂 GPU 部署的支援。

核心能力

基準測試 GPU 與引擎選項

RunInfra 會針對所描述的工作負載比較 serving 引擎與 GPU 目標,然後在選定路徑前先對候選項目進行基準測試。網站顯示會跨引擎、GPU 類別、p95 延遲、吞吐量、VRAM 與成本進行比較。

為模型調校執行路徑

產品會在支援的情況下套用最佳化步驟,包括量化、kernel 調校、KV cache 重用、speculative decoding、prefix caching、FlashAttention v2,以及與批次處理相關的 serving 設定。首頁將這些呈現為調校流程的一部分,而非使用者必須手動撰寫的設定。

產出可檢視的結果

每次執行都會產出可檢視的基準測試收據與部署套件。網站說明該堆疊並非隱藏,且可在部署前重現或修改。

支援託管部署與匯出

RunInfra 可部署生產環境 API 端點,或將堆疊匯出供自架。首頁顯示託管端點、可匯出的 Docker 與部署檔案,以及在 RunInfra、RunPod 和 Modal 上部署的範例。

涵蓋完整最佳化工作流程

定價頁面列出 Core 方案中的 OpenAI 相容 API 端點、agent chat、plans、benchmarking、無限制 pipelines 與版本管理。這表示整體流程涵蓋規劃、測試與服務於同一系統中。

加入企業級控制與私有基礎架構

Enterprise 增加自架與自訂 GPU 部署、稽核日誌、RBAC、專屬支援,以及存取 B200/H200 GPU 的能力。安全頁面則補充了加密、記錄與事件回應等已文件化的控制項。

RunInfra 的常見使用方式

  • 為新模型選擇 serving 設定

    使用 RunInfra 選擇模型、比較 GPU 候選項,並在部署前驗證延遲、吞吐量、VRAM 與成本。這適合想以證據為基礎選擇 serving 方案,而非預設 GPU 的團隊。

  • 針對延遲或成本最佳化工作負載

    描述 chat、speech、embedding 或 retrieval 工作負載,讓平台產生最佳化的 serving 路徑。首頁展示了 Qwen、Whisper 與 BGE 類型工作負載的範例。

  • 從代管推理轉向自架部署

    當您希望由服務代管堆疊時,可先使用託管端點;之後若需要在自己的環境中執行,再匯出相同的執行套件。網站展示了在 RunInfra、RunPod 和 Modal 上部署,以及可下載的堆疊檔案。

  • 滿足企業採購與安全需求

    需要私有基礎架構、稽核日誌、RBAC 與已文件化安全態勢的企業團隊,可改用 Enterprise 方案而非 Core。安全頁面與定價頁面說明了這些控制項與支援安排。

  • 追蹤與審閱最佳化執行

    想要取得可重現基準測試結果紀錄的團隊,可使用收據與版本化 pipeline 工作流程。定價頁面提到無限制 pipelines 與版本管理,首頁則顯示含前後指標的基準測試收據。

Pros and Cons

Pros

  • 將基準測試、調校與部署整合於同一工作流程。
  • 以可衡量的輸出展示所選堆疊,例如延遲、吞吐量、VRAM 與成本。
  • 同時支援託管端點與可匯出的部署成品。
  • Core 方案採用點數模型,且沒有每席位費用。
  • 提供企業選項以支援私有基礎架構、合規與支援。

Cons

  • 公開網站對整合項目、支援的雲端,以及部分工作流程限制只提供部分說明。
  • 自架部署、自訂 GPU、RBAC 與稽核日誌等進階控制項,屬於 Enterprise 而非 Core 方案。
  • 首頁與定價頁面未提供完整的限制表或支援部署目標的完整清單。

FAQ

RunInfra 是做什麼的?

RunInfra 會將您描述的推理工作負載,對應到相容的開源模型,並比較 GPU 選項、進行基準測試,最後產出部署路徑或可匯出的堆疊。輸出可作為託管端點使用,或帶到其他環境進行自架。

RunInfra 如何計價?

定價頁面顯示 Core 為自助式月費點數方案,Enterprise 則提供專用基礎架構、合規、自訂點數用量與合約條款。Core 包含可共用的點數餘額,用於最佳化、部署和 agent。

RunInfra 支援哪些模型和引擎?

首頁與定價頁面顯示其支援開源模型與常見的 serving 引擎,例如 vLLM 和 SGLang,以及相容 OpenAI 的 API 端點。網站也顯示 Llama、Qwen、Mistral、Whisper、Gemma、DeepSeek 等模型家族。

我可以匯出或自架這個堆疊嗎?

此產品可在 RunInfra 上部署託管端點,或匯出可執行的堆疊,包括 Dockerfile、compose.yaml、k8s/deployment.yaml、serve.py、benchmark.md 和 runinfra.yaml 等檔案。網站也顯示可部署到您自己的 RunPod 帳號或 Modal 工作區。

RunInfra 是否適合重視安全性的團隊?

RunInfra 的安全頁面說明,該服務已通過 SOC 2 Type II 證明,在傳輸中使用 TLS,主要資料庫與物件儲存於靜態時採用 AES-256 加密,並具備以角色為基礎的存取控制。Enterprise 在定價頁面中包含稽核日誌與 RBAC。

Quick Facts

類別
AI 基礎架構
主要用途
最佳化並部署開源模型推理堆疊
定價模式
點數制 Core 方案加上 Enterprise 合約定價
部署方式
託管 API 端點或可匯出的堆疊
公開網站
runinfra.ai
安全性
已通過 SOC 2 Type II 證明;具文件化的加密與 RBAC