INTEGRITY Документация

Особенности использования

В настоящее время Guardrails использует Llama Guard 3 8B на Workers AI для выполнения оценки содержимого. Базовая модель может быть обновлена в будущем, и мы отразим эти изменения в Guardrails.

Так как Guardrails работает на базе Workers AI, его включение создаёт нагрузку на использование Workers AI. Отслеживать использование можно в панели управления Workers AI.

Категории рисков

Guardrails оценивает содержимое по следующим категориям риска. Каждая категория обозначается кодом, который отображается в настройках Guardrails и в AI Gateway Logs. Для каждой категории можно независимо задать значение Флаг, Игнорировать, или Block для запросов и ответов.

Guardrails оценивает категории S1 через S13, подмножество Llama Guard 3 ↗ категории риска с помощью @cf/meta/llama-guard-3-8b модель на Workers AI. Категория Llama Guard 3 S14 (злоупотребление интерпретатором кода) не оценивается Guardrails. Категория P1 представляет собой Prompt Injection и оценивается отдельно с помощью @cf/meta/prompt-guard-2-86m модель.

Эти коды также отображаются в guardrails свойство AI Gateway REST API, где вы программно настраиваете действие для каждой категории. См. create и update методы.

Код Категория
S1 Violent Crimes
S2 Non-Violent Crimes
S3 Sex-Related Crimes
S4 Child Sexual Exploitation
S5 Клевета
S6 Specialized Advice
S7 Конфиденциальность
S8 Интеллектуальная собственность
S9 Оружие неизбирательного действия
S10 Ненависть
S11 Suicide & Self-Harm
S12 Sexual Content
S13 Elections
P1 Инъекция промпта

Дополнительные соображения

Поведение потоковой передачи

Guardrails не поддерживает потоковую передачу (stream: true) запросов. Промпты по-прежнему оцениваются и применяются, но поведение ответа зависит от API-интерфейса.

В REST API (api.cloudflare.com/*), Guardrails оценивает ответ и записывает результат в журнал, но не применяет его: клиент получает полный потоковый ответ независимо от того, что могло бы быть помечено Guardrails. На конечных точках шлюза (gateway.ai.cloudflare.com/v1/*), Guardrails буферизует полный ответ, оценивает его и возвращает единый непотоковый payload: запрос больше не передается потоково.

Для нестриминговых (stream: false) запросов оцениваются и применяются как промпты, так и ответы.

Guardrails оценивает текст payload ответа, включая строки URL-адресов в ответах моделей генерации изображений. Сами изображения, на которые указывают ссылки, не запрашиваются и не оцениваются. Модели типа Embedding и модели неизвестных типов не проходят проверку ответа независимо от режима потоковой передачи.

Подробнее см. в Поддерживаемые типы моделей.

Полная поддержка Guardrails для стриминговых запросов есть в наших планах.