Workers AI は一般提供(Generally Available)です。これに合わせてレート制限を更新しています。
Wrangler を使うローカルモードでのモデル推論も、これらの制限にカウントされます。ベータモデルは、性能とスケールの作業中、より低いレート制限になることがあります。
レート制限はタスク種類ごとのデフォルトで、一部は次のようにモデル単位の制限があります。
- 毎分 720 リクエスト
- 毎分 3000 リクエスト
- 毎分 720 リクエスト
- 毎分 3000 リクエスト
- 毎分 1500 リクエスト
- 毎分 2000 リクエスト
- 毎分 3000 リクエスト
- @cf/baai/bge-large-en-v1.5 は毎分 1500 リクエスト
- 毎分 300 リクエスト。ただし、モデルが Workers Paid プランを必要とする場合を除きます
次の制限は、Workers Paid プラン が必要なモデルに対して、アカウントごと、モデルごとに適用されます。各モデルページに、対象かどうかが記載されています。これらのモデルだけが、デフォルト制限を受けません。
| 課金 | レート制限 |
|---|---|
| 標準の Workers AI 課金 | 毎分 20 リクエスト |
| 前払いの AI Gateway クレジット | 毎分 50 リクエスト |
引き上げられた制限を受けるには、前払いの AI Gateway クレジット を読み込み、ゲートウェイの Workers AI 課金設定 を Unified billing にします。これらの制限は、フロンティアモデルへのリクエスト完了に時間がかかることがある、一般的なエージェントおよびコーディングのワークロード向けです。
- 毎分 720 リクエスト
- @cf/runwayml/stable-diffusion-v1-5-img2img は毎分 1500 リクエスト
- 毎分 720 リクエスト