← Cloudflare AI Gateway / ai-gateway / features / guardrails
Особенности использования
В настоящее время Guardrails использует Llama Guard 3 8B ↗ на Workers AI для выполнения оценки содержимого. Базовая модель может быть обновлена в будущем, и мы отразим эти изменения в Guardrails.
Так как Guardrails работает на базе Workers AI, его включение создаёт нагрузку на использование Workers AI. Отслеживать использование можно в панели управления Workers AI.
Категории рисков
Guardrails оценивает содержимое по следующим категориям риска. Каждая категория обозначается кодом, который отображается в настройках Guardrails и в AI Gateway Logs. Для каждой категории можно независимо задать значение Флаг, Игнорировать, или Block для запросов и ответов.
Guardrails оценивает категории S1 через S13, подмножество Llama Guard 3 ↗ ↗ категории риска с помощью @cf/meta/llama-guard-3-8b модель на Workers AI. Категория Llama Guard 3 S14 (злоупотребление интерпретатором кода) не оценивается Guardrails. Категория P1 представляет собой Prompt Injection и оценивается отдельно с помощью @cf/meta/prompt-guard-2-86m модель.
Эти коды также отображаются в guardrails свойство AI Gateway REST API, где вы программно настраиваете действие для каждой категории. См. create и update методы.
| Код | Категория |
|---|---|
S1 |
Violent Crimes |
S2 |
Non-Violent Crimes |
S3 |
Sex-Related Crimes |
S4 |
Child Sexual Exploitation |
S5 |
Клевета |
S6 |
Specialized Advice |
S7 |
Конфиденциальность |
S8 |
Интеллектуальная собственность |
S9 |
Оружие неизбирательного действия |
S10 |
Ненависть |
S11 |
Suicide & Self-Harm |
S12 |
Sexual Content |
S13 |
Elections |
P1 |
Инъекция промпта |
Дополнительные соображения
- Доступность моделей: Если хотя бы одна категория риска установлена на
block, но AI Gateway не может получить ответ от Workers AI, запрос будет заблокирован. И наоборот, если для категории риска задано значениеflagи AI Gateway не может получить ответ от Workers AI, запрос будет обработан без проверки. Такой подход отдаёт приоритет доступности, позволяя запросам продолжаться, даже если проверка содержимого невозможна. - Влияние на задержку: включение Guardrails добавляет к запросам дополнительную задержку. Как правило, проверка с использованием Llama Guard 3 8B на Workers AI добавляет около 500 миллисекунд на запрос. Однако для более крупных запросов задержка может расти сильнее, хотя и не линейно. Учитывайте это, балансируя между безопасностью и производительностью.
- Обработка длинного контента: При оценке длинных промптов или ответов Guardrails автоматически разбивает контент на более мелкие фрагменты и обрабатывает каждый отдельным запросом Guardrails. Это обеспечивает полную модерацию, но может увеличивать задержку для более длинных входных данных.
- Поддерживаемые языки: Llama Guard 3.3 8B поддерживает классификацию безопасности контента для следующих языков: английский, французский, немецкий, хинди, итальянский, португальский, испанский и тайский.
Поведение потоковой передачи
Guardrails не поддерживает потоковую передачу (stream: true) запросов. Промпты по-прежнему оцениваются и применяются, но поведение ответа зависит от API-интерфейса.
В REST API (api.cloudflare.com/*), Guardrails оценивает ответ и записывает результат в журнал, но не применяет его: клиент получает полный потоковый ответ независимо от того, что могло бы быть помечено Guardrails. На конечных точках шлюза (gateway.ai.cloudflare.com/v1/*), Guardrails буферизует полный ответ, оценивает его и возвращает единый непотоковый payload: запрос больше не передается потоково.
Для нестриминговых (stream: false) запросов оцениваются и применяются как промпты, так и ответы.
Guardrails оценивает текст payload ответа, включая строки URL-адресов в ответах моделей генерации изображений. Сами изображения, на которые указывают ссылки, не запрашиваются и не оцениваются. Модели типа Embedding и модели неизвестных типов не проходят проверку ответа независимо от режима потоковой передачи.
Подробнее см. в Поддерживаемые типы моделей.
Полная поддержка Guardrails для стриминговых запросов есть в наших планах.