INTEGRITY Dokumentace

nastavení robots.txt

Společnosti zabývající se umělou inteligencí využívají crawlery ke shromažďování obsahu webových stránek pro trénování jazykových modelů, generování odpovědí ve vyhledávání a další účely. robots.txt soubor v kořenovém adresáři vaší domény říká těmto crawlerům, ke kterému obsahu mají nebo nemají přistupovat. Když zapnete spravovaný robots.txt nastavení Cloudflare generuje a spravuje robots.txt soubor, který známým AI crawlerům nařizuje, aby se vašemu obsahu vyhýbali.

robots.txt dodržování je dobrovolné. Soubor vyjadřuje vaše preference, technicky ale prohledávačům v přístupu k vašemu obsahu nebrání. Někteří provozovatelé prohledávačů mohou váš robots.txt direktivy (pokyny jako Disallow: /) a stejně tak procházet váš obsah.

Kompatibilita se stávajícími robots.txt soubory

Cloudflare zjišťuje, zda váš origin server již má robots.txt soubor a odpovídajícím způsobem jej upraví: buď jej sloučí s vaším existujícím souborem, nebo vytvoří nový.

Existující soubor robots.txt

Pokud váš web už má robots.txt soubor, ověřený pomocí HTTP 200 odpověď, Cloudflare před ni přidá naši spravovanou robots.txt před vaše stávající robots.txt, čímž obě spojí do jediné odpovědi.

Pokud tuto funkci například nemáte zapnutou, robots.txt obsah crawlstop.com by bylo:

Funkce není zapnuta
User-agent: *
Disallow: /lp
Disallow: /feedback
Disallow: /langtest

Sitemap: https://www.crawlstop.com/sitemap.xml

Pomocí spravovaného robots.txt povoleno, Cloudflare před váš původní obsah vloží náš spravovaný obsah, což si můžete prohlédnout na https://www.crawlstop.com/robots.txt.

Funkce zapnuta
# As a condition of accessing this website, you agree to abide by the
# following content signals:

# (a)  If a content-signal = yes, you may collect content for the
#      corresponding use.
# (b)  If a content-signal = no, you may not collect content for the
#      corresponding use.
# (c)  If the website operator does not include a content signal for a
#      corresponding use, the website operator neither grants nor restricts
#      permission via content signal with respect to the corresponding use.

# The content signals and their meanings are:

# search: building a search index and providing search results (e.g., returning
#         hyperlinks and short excerpts from your website's contents). Search
#         does not include providing AI-generated search summaries.
# ai-input: inputting content into one or more AI models (e.g., retrieval
#           augmented generation, grounding, or other real-time taking of
#           content for generative AI search answers).
# ai-train: training or fine-tuning AI models.

# ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF
# RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT
# AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET.

# BEGIN Cloudflare Managed content

User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /

User-agent: Amazonbot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

# END Cloudflare Managed Content
User-agent: *
Disallow: /lp
Disallow: /feedback
Disallow: /langtest

Sitemap: https://www.crawlstop.com/sitemap.xml

Žádný soubor robots.txt

Pokud váš web nemá robots.txt soubor, Cloudflare vytvoří nový soubor se spravovaným Disallow pravidla pro známé AI crawlery a poskytuje je za vás.

Implementace

Chcete-li implementovat robots.txt soubor na vaší doméně:

  1. V dashboardu Cloudflare přejděte na Security Settings stránce.

    Přejděte na Nastavení ↗
  2. Filtrovat podle Provoz botů.

  3. Přejděte na Nastavte svou preferenci pro blokování trénování v robots.txt.

  4. Zapněte Nastavte svou preferenci pro blokování trénování v robots.txt.

Content Signals Policy

Content Signals jsou sadou strojově čitelných direktiv v robots.txt souboru, které určují, jak mohou crawlery používat váš obsah. Těmito třemi kategoriemi jsou search (vytváření vyhledávacího indexu), ai-input (poskytování obsahu modelům AI pro odpovědi v reálném čase) a ai-train (trénování nebo doladění modelů AI).

Domény v plánu Free, které nemají vlastní robots.txt soubor a nepoužíváte spravovaný robots.txt funkce zobrazí Content Signals Policy, když si crawler vyžádá robots.txt soubor pro vaši doménu.

Content Signals Policy tyto kategorie definuje, ale nevyjadřuje žádné konkrétní preference ohledně vašeho obsahu. Chcete-li nastavit preference (například ai-train=no), zapněte spravované robots.txt funkce.

Content Signals Policy
# As a condition of accessing this website, you agree to abide by the
# following content signals:

# (a)  If a content-signal = yes, you may collect content for the
#      corresponding use.
# (b)  If a content-signal = no, you may not collect content for the
#      corresponding use.
# (c)  If the website operator does not include a content signal for a
#      corresponding use, the website operator neither grants nor restricts
#      permission via content signal with respect to the corresponding use.

# The content signals and their meanings are:

# search: building a search index and providing search results (e.g., returning
#         hyperlinks and short excerpts from your website's contents). Search
#         does not include providing AI-generated search summaries.
# ai-input: inputting content into one or more AI models (e.g., retrieval
#           augmented generation, grounding, or other real-time taking of
#           content for generative AI search answers).
# ai-train: training or fine-tuning AI models.

# ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF
# RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT
# AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET.

Content Signals Policy společnosti Cloudflare je ve výchozím nastavení součástí robots.txt soubor, když zapnete nastavení robots.txt.

Pokud chcete zobrazování zásad ve vašem robots.txt soubor, můžete zrušit zaškrtnutí Zobrazit Content Signals Policy v části Ovládání AI prohledávačů v přehledu vaší zóny.

Přejděte na Přehled ↗

Případně můžete použít Security Settings.

Signál pro použití obsahu

Cloudflare testuje content-use, volitelné rozšíření Content Signals která se nachází ve vašem robots.txt. Přidává čtvrté pole vedle stávajících search, ai-input, a ai-train signály k popisu toho, co si crawler smí ponechat a znovu použít po přístupu k vašemu obsahu. Pole nabývá jedné ze tří hodnot, od nejméně po nejvíce permisivní:

Hodnota Význam
use=immediate Interagovat, ale nic neukládat ani opakovaně nepoužívat.
use=reference Indexovat, vytvářet úryvky a odkazovat zpět.
use=full Shrňte a zopakujte.

Pro zákazníky, kteří mají zapnuté spravované robots.txt nastavení Cloudflare přidává use=reference ke spravovanému obsahu, v souladu se stávajícím výchozím nastavením search=yes,ai-train=no:

Spravovaný robots.txt se signálem content-use
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /

Dostupnost

Spravovaný robots.txt pro AI crawlery je k dispozici ve všech plánech.