inferock-bench icon

inferock-bench

inferock-bench は、LLM API トラフィックをローカルで診断するプロキシです。各呼び出しの使用量、失敗、タイミングを記録し、請求整合性の確認用レシートを生成します。トークン使用量の監査や、失敗した呼び出しが課金に影響したかを調べるチームや個人向けです。

inferock-bench

ローカル LLM コスト追跡プロキシ

inferock-bench は、メータリングされた LLM API トラフィック向けのローカル診断プロキシです。リクエストを localhost 経由でルーティングし、呼び出しごとのイベントを記録し、それらのイベントを使用量、タイミング、失敗、請求関連シグナルを要約したレシートに変換します。

このプロジェクトは、AI 支出と請求整合性を呼び出し単位で確認する必要がある人向けです。README では、AI または LLM の請求を監査し、トークン使用量をローカルで確認し、失敗した API 呼び出しが請求された可能性があるかを調べるための手段として説明されています。

主な機能

ローカルでの呼び出し単位計測

プロキバイダが報告する使用量、価格の証跡、リクエストとレスポンスのメタデータ、ステータス、タイミング、リトライの証跡、およびプロキシが実際に確認した呼び出しに関する検出シグナルを計測します。

失敗と請求整合性の証跡

課金や監査ログに影響しうる配信失敗を記録します。これには、請求済みの空出力、拒否、切り詰め、トークン再計数の不一致、重複リクエスト ID、キャッシュ割引リスクの証跡、プロバイダ障害によるリトライが含まれます。

カバレッジ状態の可視化

各サーフェスに watched-clean、signal、not-openable を付与し、ユーザーがチェック未実施の箇所を、クリーンな結果と誤解しないようにします。

レシート生成

保存されたイベント記録から、同梱の @inferock/measure グレーディングコードと The Inferock Standard を使ってレシートを生成します。

キーとレシートのローカル優先処理

プロバイダのキーはプロキシのワークフロー内にローカルで保持し、Inferock には送信しません。レシートも、ユーザーが共有しない限りローカルに残ります。

計測対象プロバイダの範囲

4 つの計測済みプロバイダ平面を対象としつつ、現時点ではまだ計測されていない他のサーフェスにも拡張できるようにしています。

主な使い方

  • リクエスト単位で AI 支出を監査する

    何が請求され、何が失敗し、どのタイミングやリトライの証跡がリクエストに付随していたかを、呼び出し単位で記録したいときにプロキシを使います。

  • トークン使用量をローカルで確認する

    請求書の合計やダッシュボードの要約を頼る前に、自分のマシン経由でルーティングされたプロバイダ呼び出しのトークン使用量をローカルで確認するために使います。

  • 請求整合性の疑問を調べる

    失敗したリクエストが課金に影響した可能性がある場合、特に空出力、拒否、切り詰め、リトライ動作を含むケースで、レシート出力を使って調査します。

  • 何がチェックされ、何がされていないかを確認する

    サーフェスが正常に監視されたか、シグナルが出たか、計測実行で開けなかったかを、カバレッジ状態ラベルで確認します。

  • 診断証跡をローカルに保持する

    プロバイダのキーや生の請求データを第三者に送るのではなく、自分の環境に保持できる証跡が必要なときに、ローカルの記録とレシートを使います。

Pros and Cons

Pros

  • 呼び出しごとの使用量、タイミング、リトライ、価格の証跡を 1 つのローカルなワークフローで取得します。
  • 切り詰め、重複リクエスト ID、キャッシュ割引リスクのシグナルなど、請求関連の失敗モードを強調します。
  • ユーザーが共有を選ばない限り、レシートはローカルに保持されます。
  • 未実施のチェックを、静かにクリーン扱いするのではなく、サーフェスのカバレッジ状態で可視化します。

Cons

  • ローカルプロキシ経由でルーティングされたトラフィックのみを計測するため、バイパスされた呼び出しは対象外です。
  • README では、対応する請求書がなければ月次請求を説明できないとされています。
  • カバレッジは計測済みのプロバイダ平面に限られ、それ以外のサーフェスは「拡張可能な設計」とされており、現時点では計測されません。

FAQ

inferock-bench は何をするものですか?

ローカルの診断プロキシで、localhost 経由でルーティングされた呼び出しを計測し、記録されたイベントからレシートを生成します。README では、OpenAI、Anthropic、Gemini Developer API、固定 OpenRouter エンドポイント向けのローカル LLM コスト追跡プロキシとして説明されています。

どのプロバイダをサポートしていますか?

README では、OpenAI、Anthropic、Gemini Developer API、固定 OpenRouter エンドポイントが計測対象のプロバイダ平面として挙げられています。また、OpenRouter の対象には meta-llama、deepseek、mistral、moonshot/kimi、z-ai/glm、qwen などの確認済みホストが含まれると記載されています。

これは誰向けですか?

このプロジェクトは、AI または LLM の請求を監査し、トークン使用量をローカルで計測し、失敗した API 呼び出しが課金に影響した可能性があるかを調べるのに役立つよう設計されています。特に、呼び出し単位のレシートと請求整合性の確認に重点があります。

どのような出力を生成しますか?

このベンチマークはローカルのイベント記録を保存し、付属の @inferock/measure のグレーディングコードと The Inferock Standard を使ってレシートを生成します。README では、ユーザーが共有しない限りレシートはローカルに残ると強調されています。

重要な制限はありますか?

いいえ。README では、ローカルプロキシをバイパスしたトラフィックの監査、見えない呼び出しにまたがるプロバイダ支出の上限管理、対応する請求書がない月次請求の説明はできないとしています。また、計測対象外の範囲は「拡張可能な設計」であり、現時点では計測されないとも述べています。

Quick Facts

カテゴリ
開発者向けツール
主な用途
ローカルでの AI 請求およびトークン使用量の監査
対応プロバイダ
OpenAI、Anthropic、Gemini Developer API、固定 OpenRouter エンドポイント
ワークフロー
localhost 経由で呼び出しをルーティングし、イベントを記録し、レシートを生成
ソースドメイン
github.com
価格
公開 GitHub リポジトリ。プロジェクトページでは製品価格は公開されていません
inferock-bench - AI Tool, Features, Use Cases & Alternatives | UStack