INTEGRITY Dokumentace

Úvahy o používání

Guardrails aktuálně používá Llama Guard 3 8B na Workers AI k provádění hodnocení obsahu. Podkladový model může být v budoucnu aktualizován a tyto změny promítneme do Guardrails.

Guardrails běží na Workers AI, takže jeho aktivace zvyšuje využití Workers AI. Toto využití můžete sledovat v dashboardu Workers AI.

Kategorie rizik

Guardrails vyhodnocují obsah podle následujících kategorií rizik. Každá kategorie je označena kódem, který se zobrazuje v konfiguraci Guardrail a v AI Gateway Logs. Každou kategorii můžete nezávisle nastavit na Příznak, Ignorovat, nebo Block pro prompty a odpovědi.

Guardrails vyhodnocují kategorie S1 přes S13, podmnožina Llama Guard 3 ↗ kategorií rizik, s využitím @cf/meta/llama-guard-3-8b model na Workers AI. Kategorie Llama Guard 3 S14 (zneužití interpretu kódu) není vyhodnocováno nástrojem Guardrails. Kategorie P1 je prompt injection, což se vyhodnocuje samostatně pomocí @cf/meta/prompt-guard-2-86m model.

Tyto kódy se také zobrazují v guardrails vlastnost AI Gateway REST API, kde programově nakonfigurujete akci pro každou kategorii. Viz create a update metody.

Kód Kategorie
S1 Violent Crimes
S2 Non-Violent Crimes
S3 Sex-Related Crimes
S4 Sexuální zneužívání dětí
S5 Pomluva
S6 Specialized Advice
S7 Soukromí
S8 Intellectual Property
S9 Indiscriminate Weapons
S10 Nenávist
S11 Suicide & Self-Harm
S12 Sexual Content
S13 Volby
P1 Prompt Injection

Další aspekty

Chování streamování

Guardrails nepodporuje streamování (stream: true) požadavků. Prompty jsou nadále vyhodnocovány a vynucovány, ale chování odpovědi závisí na použitém rozhraní API.

V REST API (api.cloudflare.com/*), Guardrails vyhodnotí odpověď a zaznamená výsledek, ale nevynucuje jej: klient obdrží celou streamovanou odpověď bez ohledu na to, co by Guardrails označily. Na koncových bodech gateway (gateway.ai.cloudflare.com/v1/*), Guardrails uloží celou odpověď do vyrovnávací paměti, vyhodnotí ji a vrátí jedinou nestreamovanou odpověď: požadavek se tak dále nestreamuje.

Pro nestreamované (stream: false) požadavků jsou vyhodnocovány a vynucovány jak prompty, tak odpovědi.

Guardrails vyhodnocují text payloadu odpovědi, včetně URL řetězců v odpovědích modelů pro generování obrázků. Neprovádí načtení ani vyhodnocení odkazovaných obrázků. Modely typu Embedding a neznámé typy modelů vyhodnocení odpovědi obcházejí bez ohledu na režim streamování.

Další informace najdete v tématu Podporované typy modelů.

Plná podpora Guardrails pro streamované požadavky je na naší roadmapě.