Skip to content

非公式本サイトは非公式の日本語ドキュメントであり、Cloudflare 公式サイトではありません。最新情報はdevelopers.cloudflare.comをご確認ください。

コストを抑え、品質を高める

最終更新 Markdown で表示Agent セットアップ

アプリケーションの規模が大きくなると、とくに複数プロバイダーを使う場合、AI 推論コストは予測しにくくなります。Cloudflare AI Gateway は同一クエリをキャッシュして重複する推論呼び出しを避け、ユーザーまたは API キー単位でレート制限を適用し、すべてのプロバイダーを横断した統合分析を提供します。

ソリューション

AI Gateway

レスポンスをキャッシュし、リクエストをレート制限し、プロバイダー横断で利用状況を監視します。AI Gateway の詳細 を参照してください。

  • レスポンスキャッシュ - 同一クエリをキャッシュし、繰り返されるプロンプトで新しい推論呼び出しが走らないようにします
  • レート制限 - ユーザーまたは API キー単位でリクエスト上限を設定し、不正利用と支出を抑えます
  • 統合分析 - 1 つのダッシュボードで、すべての AI プロバイダーの利用状況、レイテンシ、コストを追跡します

Workers Analytics Engine

Workers から時系列の分析データを保存し、クエリします。Workers Analytics Engine の詳細 を参照してください。

  • カスタムメトリクス - トークン、レイテンシ分布、エラー率を追跡する AI 向けダッシュボードを構築します

利用を開始する

  1. AI Gateway の利用を開始する
  2. キャッシュを設定する
  3. Workers Analytics Engine の利用を開始する

役に立ちましたか?