← Решения Cloudflare по борьбе с ботами / bots / additional-configurations
настройка robots.txt
ИИ-компании используют краулеры для сбора контента с сайтов, чтобы обучать языковые модели, формировать ответы для поиска и решать другие задачи. robots.txt файл в корне вашего домена сообщает этим краулерам, к какому контенту они могут или не могут обращаться. Когда вы включаете управляемый robots.txt параметре Cloudflare создаёт и поддерживает robots.txt файл, который предписывает известным AI-краулерам не обращаться к вашему контенту.
robots.txt соблюдение носит добровольный характер. Файл выражает ваши предпочтения, но технически не мешает краулерам обращаться к вашему контенту. Некоторые операторы краулеров могут игнорировать ваш robots.txt директивы (инструкции вида Disallow: /) и всё равно сканируют ваш контент.
Совместимость с существующими robots.txt файлы
Cloudflare определяет, есть ли у вашего исходного сервера уже robots.txt файл и соответствующим образом его адаптирует: либо объединяет с вашим существующим файлом, либо создаёт новый с нуля.
Существующий файл robots.txt
Если на вашем сайте уже есть robots.txt файл, который подтверждается HTTP 200 ответ: Cloudflare добавит в начало наш управляемый robots.txt перед вашими существующими robots.txt, объединяя их в единый ответ.
Например, без включения этой функции robots.txt содержимое crawlstop.com будет:
User-agent: *
Disallow: /lp
Disallow: /feedback
Disallow: /langtest
Sitemap: https://www.crawlstop.com/sitemap.xmlС управляемым robots.txt включено, Cloudflare добавляет управляемый контент перед вашим исходным контентом, в результате чего вы можете увидеть его по адресу https://www.crawlstop.com/robots.txt ↗.
# As a condition of accessing this website, you agree to abide by the
# following content signals:
# (a) If a content-signal = yes, you may collect content for the
# corresponding use.
# (b) If a content-signal = no, you may not collect content for the
# corresponding use.
# (c) If the website operator does not include a content signal for a
# corresponding use, the website operator neither grants nor restricts
# permission via content signal with respect to the corresponding use.
# The content signals and their meanings are:
# search: building a search index and providing search results (e.g., returning
# hyperlinks and short excerpts from your website's contents). Search
# does not include providing AI-generated search summaries.
# ai-input: inputting content into one or more AI models (e.g., retrieval
# augmented generation, grounding, or other real-time taking of
# content for generative AI search answers).
# ai-train: training or fine-tuning AI models.
# ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF
# RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT
# AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET.
# BEGIN Cloudflare Managed content
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /
User-agent: Amazonbot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: GPTBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
# END Cloudflare Managed Content
User-agent: *
Disallow: /lp
Disallow: /feedback
Disallow: /langtest
Sitemap: https://www.crawlstop.com/sitemap.xmlФайл robots.txt отсутствует
Если на вашем сайте нет robots.txt файл, Cloudflare создаёт новый файл с управляемыми Disallow правила для известных AI-краулеров и предоставляет его вам.
Внедрение
Чтобы реализовать robots.txt файл в вашем домене:
-
На панели управления Cloudflare перейдите к разделу Security Settings страницу.
Перейдите в Настройки ↗ -
Фильтр по Ботовый трафик.
-
Перейдите в Укажите в robots.txt, следует ли блокировать использование данных для обучения.
-
Включите Укажите в robots.txt, следует ли блокировать использование данных для обучения.
Content Signals Policy
Content Signals представляют собой набор машиночитаемых директив в robots.txt файле, которые определяют, как краулеры могут использовать ваш контент. Существуют три категории: search (создание поискового индекса), ai-input (передача контента в модели ИИ для ответов в реальном времени) и ai-train (обучение или дообучение моделей ИИ).
Домены на плане Free, у которых нет собственного robots.txt файл и не используете управляемый robots.txt функция отображает Content Signals Policy, когда краулер запрашивает robots.txt файл для вашего домена.
Content Signals Policy определяет эти категории, но не выражает никаких конкретных предпочтений относительно вашего контента. Чтобы задать предпочтения (например, ai-train=no), включите управляемый robots.txt функция.
# As a condition of accessing this website, you agree to abide by the
# following content signals:
# (a) If a content-signal = yes, you may collect content for the
# corresponding use.
# (b) If a content-signal = no, you may not collect content for the
# corresponding use.
# (c) If the website operator does not include a content signal for a
# corresponding use, the website operator neither grants nor restricts
# permission via content signal with respect to the corresponding use.
# The content signals and their meanings are:
# search: building a search index and providing search results (e.g., returning
# hyperlinks and short excerpts from your website's contents). Search
# does not include providing AI-generated search summaries.
# ai-input: inputting content into one or more AI models (e.g., retrieval
# augmented generation, grounding, or other real-time taking of
# content for generative AI search answers).
# ai-train: training or fine-tuning AI models.
# ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF
# RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT
# AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET.Content Signals Policy от Cloudflare по умолчанию включена в robots.txt файл, когда вы включаете настройка robots.txt.
Если вы хотите отказаться от отображения политики в своём robots.txt файл, вы можете снять флажок Отображение Content Signals Policy в разделе Управление краулерами ИИ в обзоре вашей зоны.
Также можно использовать Security Settings.
Сигнал использования контента
Cloudflare тестирует content-use, необязательное расширение для Content Signals ↗ который находится в вашем robots.txt. Он добавляет четвёртое поле наряду с уже существующими search, ai-input, а также ai-train сигналы, описывающие, что краулер может сохранять и повторно использовать после обращения к вашему контенту. Поле принимает одно из трёх значений, от наименее до наиболее разрешительного:
| Значение | Значение |
|---|---|
use=immediate |
Взаимодействовать, но ничего не сохранять и не использовать повторно. |
use=reference |
Индексировать, показывать фрагмент и давать обратную ссылку. |
use=full |
Обобщите и воспроизведите. |
Для клиентов, включивших управляемое robots.txt параметре Cloudflare добавляет use=reference к управляемому контенту, в соответствии с существующим значением по умолчанию search=yes,ai-train=no:
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /Доступность
Managed robots.txt для AI-краулеров доступен на всех тарифных планах.