← Cloudflare AI Gateway / ai-gateway / evaluations
Nastavení Evaluations
Tento návod vás provede procesem nastavení evaluation v AI Gateway. Tyto kroky se provádějí v Cloudflare dashboard ↗.
1. Vyberte nebo vytvořte dataset
Datové sady jsou kolekce protokolů uložených pro analýzu, které lze použít při hodnocení. Datové sady vytvoříte použitím filtrů na kartě Logs. Poté se automaticky aktualizují podle nastavených filtrů.
Nastavit dataset z karty Logs
- Použijte filtry k zúžení protokolů. Možnosti filtrování zahrnují poskytovatele, počet tokenů, stav požadavku a další.
- Vyberte Create Dataset k uložení filtrovaných protokolů pro pozdější analýzu.
Datasety můžete spravovat výběrem Spravovat datasety z karty Logs.
Seznam dostupných filtrů
| Kategorie filtru | Možnosti filtrování | Filtrovat podle popisu |
|---|---|---|
| Stav | chyba, stav | typ chyby nebo stav. |
| Cache | uloženo v mezipaměti, neuloženo v mezipaměti | podle toho, zda byly uloženy v mezipaměti, nebo ne. |
| Poskytovatel | konkrétní poskytovatelé | vybraný poskytovatel AI. |
| Modely AI | konkrétní modely | vybraný model AI. |
| Náklady | menší než, větší než | náklady, se zadáním prahové hodnoty. |
| Typ požadavku | Workers AI Binding, WebSockets | typ požadavku. |
| Tokeny | Celkový počet tokenů, vstupní tokeny, výstupní tokeny | počet tokenů (menší nebo větší než). |
| Doba trvání | menší než, větší než | doba trvání požadavku. |
| Zpětná vazba | rovná se, nerovná se (palec nahoru, palec dolů, žádná zpětná vazba) | typ zpětné vazby. |
| Klíč metadat | rovná se, nerovná se | konkrétní klíče metadat. |
| Hodnota metadat | rovná se, nerovná se | konkrétní hodnoty metadat. |
| ID protokolu | rovná se, nerovná se | konkrétní Log ID. |
| ID události | rovná se, nerovná se | konkrétní Event ID. |
2. Vyberte evaluátory
Po vytvoření datové sady vyberte parametry hodnocení:
- Náklady: Vypočítá průměrné náklady na požadavky na inferenci v rámci datasetu (pouze pro požadavky s data o nákladech).
- Rychlost: Vypočítá průměrnou dobu trvání požadavků na inferenci v rámci datasetu.
- Výkon:
- Human feedback: měří výkon na základě human feedback, vypočítaného jako % kladných hodnocení (palec nahoru) u protokolů, anotovaných na kartě Logs.
3. Pojmenujte, zkontrolujte a spusťte hodnocení
- Vytvořte jedinečný název pro svůj evaluation, abyste na něj mohli v dashboardu odkazovat.
- Zkontrolujte vybraný dataset a evaluátory.
- Vyberte Spustit pro zahájení procesu.
4. Zkontrolujte a analyzujte výsledky
Výsledky vyhodnocení se zobrazí na kartě Evaluations. Výsledky ukazují stav vyhodnocení (například probíhá, dokončeno nebo chyba). Zobrazí se metriky pro vybrané evaluátory, přičemž protokoly s chybějícími poli budou vynechány. Uvidíte také počet protokolů použitých k výpočtu jednotlivé metriky.
Datasety se automaticky aktualizují na základě filtrů, evaluations nikoli. Pokud chcete vyhodnotit nové protokoly, budete muset vytvořit nový evaluation.
Pomocí těchto poznatků optimalizujte řešení podle priorit vaší aplikace. Na základě výsledků se můžete rozhodnout:
- Změňte model nebo poskytovatel
- Upravte své prompty
- Prozkoumejte další optimalizace, například nastavení Generování rozšířené vyhledáváním (RAG)