← Cloudflare Workers AI / workers-ai / platform
Лимиты
Workers AI теперь общедоступна. В связи с этим мы обновили лимиты скорости запросов.
Обратите внимание, что инференс модели в локальном режиме через Wrangler тоже учитывается в этих лимитах. У бета-моделей ограничения частоты запросов могут быть ниже, пока мы работаем над производительностью и масштабированием.
По умолчанию лимиты запросов задаются для каждого типа задачи, а для некоторых моделей дополнительно определены следующие лимиты:
Лимиты запросов по типу задачи
- 720 запросов в минуту
- 3000 запросов в минуту
- 720 запросов в минуту
- 3000 запросов в минуту
- 1500 запросов в минуту
- 2000 запросов в минуту
- 3000 запросов в минуту
- @cf/baai/bge-large-en-v1.5 составляет 1500 запросов в минуту
- 300 запросов в минуту
- @hf/thebloke/mistral-7b-instruct-v0.1-awq составляет 400 запросов в минуту
- @cf/microsoft/phi-2 составляет 720 запросов в минуту
- @cf/qwen/qwen1.5-0.5b-chat составляет 1500 запросов в минуту
- @cf/qwen/qwen1.5-1.8b-chat составляет 720 запросов в минуту
- @cf/qwen/qwen1.5-14b-chat-awq составляет 150 запросов в минуту
- @cf/tinyllama/tinyllama-1.1b-chat-v1.0 составляет 720 запросов в минуту
Передовые модели
Ниже приведены ограничения, которые действуют в расчёте на один аккаунт и одну модель:
| Модель | Стандартная тарификация Workers AI | Предоплаченные кредиты AI Gateway |
|---|---|---|
| @cf/moonshotai/kimi-k2.6 | 20 запросов в минуту | 50 запросов в минуту |
| @cf/moonshotai/kimi-k2.7-code | 20 запросов в минуту | 50 запросов в минуту |
| @cf/zai-org/glm-5.2 | 20 запросов в минуту | 50 запросов в минуту |
Чтобы получить повышенный лимит, загрузите предоплаченные кредиты AI Gateway и задайте у шлюза настройка биллинга Workers AI к Единый биллинг. Эти ограничения предназначены для типичных нагрузок в агентных сценариях и задачах написания кода, где запросы к передовым моделям могут выполняться дольше.
- 720 запросов в минуту
- @cf/runwayml/stable-diffusion-v1-5-img2img составляет 1500 запросов в минуту
- 720 запросов в минуту