← Cloudflare AI Gateway / ai-gateway / features / guardrails
Úvahy o používání
Guardrails aktuálně používá Llama Guard 3 8B ↗ na Workers AI k provádění hodnocení obsahu. Podkladový model může být v budoucnu aktualizován a tyto změny promítneme do Guardrails.
Guardrails běží na Workers AI, takže jeho aktivace zvyšuje využití Workers AI. Toto využití můžete sledovat v dashboardu Workers AI.
Kategorie rizik
Guardrails vyhodnocují obsah podle následujících kategorií rizik. Každá kategorie je označena kódem, který se zobrazuje v konfiguraci Guardrail a v AI Gateway Logs. Každou kategorii můžete nezávisle nastavit na Příznak, Ignorovat, nebo Block pro prompty a odpovědi.
Guardrails vyhodnocují kategorie S1 přes S13, podmnožina Llama Guard 3 ↗ ↗ kategorií rizik, s využitím @cf/meta/llama-guard-3-8b model na Workers AI. Kategorie Llama Guard 3 S14 (zneužití interpretu kódu) není vyhodnocováno nástrojem Guardrails. Kategorie P1 je prompt injection, což se vyhodnocuje samostatně pomocí @cf/meta/prompt-guard-2-86m model.
Tyto kódy se také zobrazují v guardrails vlastnost AI Gateway REST API, kde programově nakonfigurujete akci pro každou kategorii. Viz create a update metody.
| Kód | Kategorie |
|---|---|
S1 |
Violent Crimes |
S2 |
Non-Violent Crimes |
S3 |
Sex-Related Crimes |
S4 |
Sexuální zneužívání dětí |
S5 |
Pomluva |
S6 |
Specialized Advice |
S7 |
Soukromí |
S8 |
Intellectual Property |
S9 |
Indiscriminate Weapons |
S10 |
Nenávist |
S11 |
Suicide & Self-Harm |
S12 |
Sexual Content |
S13 |
Volby |
P1 |
Prompt Injection |
Další aspekty
- Dostupnost modelu: Pokud je alespoň jedna kategorie rizika nastavena na
block, ale AI Gateway nemůže od Workers AI přijmout odpověď, požadavek bude zablokován. Naopak pokud je kategorie rizika nastavena naflaga AI Gateway nezíská odpověď od Workers AI, požadavek bude pokračovat bez vyhodnocení. Tento přístup upřednostňuje dostupnost a umožňuje pokračovat v požadavcích i v případě, že vyhodnocení obsahu není možné. - Dopad na latenci: Zapnutí Guardrails přidává k požadavkům další latenci. Vyhodnocení pomocí modelu Llama Guard 3 8B na Workers AI obvykle přidá přibližně 500 milisekund na požadavek. U větších požadavků však může být nárůst latence vyšší, i když tento nárůst není lineární. Zohledněte to při vyvažování bezpečnosti a výkonu.
- Zpracování dlouhého obsahu: Při vyhodnocování dlouhých promptů nebo odpovědí Guardrails automaticky rozdělí obsah na menší části a každou zpracuje samostatným požadavkem Guardrail. Tento přístup zajišťuje komplexní moderování, ale u delších vstupů může zvýšit latenci.
- Podporované jazyky: Llama Guard 3.3 8B podporuje klasifikaci bezpečnosti obsahu v následujících jazycích: angličtina, francouzština, němčina, hindština, italština, portugalština, španělština a thajština.
Chování streamování
Guardrails nepodporuje streamování (stream: true) požadavků. Prompty jsou nadále vyhodnocovány a vynucovány, ale chování odpovědi závisí na použitém rozhraní API.
V REST API (api.cloudflare.com/*), Guardrails vyhodnotí odpověď a zaznamená výsledek, ale nevynucuje jej: klient obdrží celou streamovanou odpověď bez ohledu na to, co by Guardrails označily. Na koncových bodech gateway (gateway.ai.cloudflare.com/v1/*), Guardrails uloží celou odpověď do vyrovnávací paměti, vyhodnotí ji a vrátí jedinou nestreamovanou odpověď: požadavek se tak dále nestreamuje.
Pro nestreamované (stream: false) požadavků jsou vyhodnocovány a vynucovány jak prompty, tak odpovědi.
Guardrails vyhodnocují text payloadu odpovědi, včetně URL řetězců v odpovědích modelů pro generování obrázků. Neprovádí načtení ani vyhodnocení odkazovaných obrázků. Modely typu Embedding a neznámé typy modelů vyhodnocení odpovědi obcházejí bez ohledu na režim streamování.
Další informace najdete v tématu Podporované typy modelů.
Plná podpora Guardrails pro streamované požadavky je na naší roadmapě.