Про ИИ-краулеров обычно пишут списком: вот двенадцать агентов, вот строки
для robots.txt. Список без разбора бесполезен, потому что агенты решают
три разные задачи, и запрет каждой стоит вам разного.
Ниже разбор по официальной документации владельцев, а не по чужим обзорам.
Три задачи, которые путают в одну
Обучение. Агент собирает содержимое, которое может попасть в обучающую выборку модели. Прямой пользы сайту нет, отложенная спорна.
Ответ на вопрос пользователя. Агент заходит на страницу, потому что человек прямо сейчас что-то спросил и ответ требует посмотреть источник. Это не обход, это переход по вашей ссылке, инициированный человеком.
Поисковый индекс ИИ-поиска. Агент собирает содержимое, чтобы показывать сайт в ответах со ссылкой. Это ближайший аналог обычного поискового робота.
Запрет первого и запрет третьего дают противоположные результаты: первый ничего вам не стоит, третий убирает из ответов вместе со ссылкой.
OpenAI: четыре агента
По документации OpenAI для владельцев сайтов:
GPTBot обходит содержимое, которое может использоваться при обучении
базовых генеративных моделей.
OAI-SearchBot показывает сайты в результатах поиска ChatGPT.
ChatGPT-User используется для отдельных действий пользователя в ChatGPT
и пользовательских GPT; документация прямо оговаривает, что для
автоматического обхода он не применяется.
OAI-AdsBot проверяет безопасность страниц, поданных как реклама в ChatGPT.
Anthropic: три агента
По справке Anthropic:
ClaudeBot собирает содержимое, которое может участвовать в обучении
моделей.
Claude-User заходит на сайт, когда пользователь задал вопрос Claude.
Claude-SearchBot анализирует содержимое, чтобы повысить качество и точность
поисковых ответов.
Google: два токена, и один из них часто понимают неверно
Google-Extended управляет только тем, может ли содержимое
использоваться при обучении моделей Gemini и связанных с ними возможностей.
Документация Google говорит об этом прямо: на попадание в поиск и на
ранжирование он не влияет.
Это главное недоразумение темы. Запрет Google-Extended не убирает сайт
из поиска и не понижает его. И наоборот, разрешение не добавляет видимости.
GoogleOther собирает общедоступное содержимое для разных продуктовых
команд, не относясь ни к какому одному продукту.
Perplexity: два агента
PerplexityBot показывает и связывает сайты в результатах Perplexity;
для обучения моделей он, по документации, не используется.
Perplexity-User заходит на страницу, когда пользователь задал вопрос
и ответ требует посмотреть источник.
Apple и Common Crawl
Applebot обходит сайты для поиска в Spotlight, Siri и Safari.
Applebot-Extended ничего не обходит: это управляющий токен, которым
издатель отказывается от использования содержимого при обучении моделей
Apple.
CCBot собирает открытый набор данных Common Crawl, которым пользуются
исследователи и третьи стороны. Представляется он строкой
CCBot/2.0 (https://commoncrawl.org/faq/), а список его адресов публикуется
отдельным файлом для сверки.
Чего robots.txt не может
Здесь заканчивается документация и начинается наш замер.
robots.txt это просьба, а не забор. Её соблюдают те, кто хочет
соблюдать, и не видят те, кто не представляется.
Мы разбирали свой счётчик за три месяца: из 909 визитов 609 роботные, и из этих 609 589 представлялись обычным Google Chrome, почти все прямыми заходами. По браузеру и источнику они неотличимы от человека. Полный разбор с числами выложили отдельно.
Отсюда простое следствие: строки в robots.txt управляют поведением тех
агентов, которые называют себя честно. Ровно тех, чей обход обычно и не
вреден.
Почему запрет обхода бывает дороже разрешения
И вторая наша находка, уже про сам механизм запрета.
Запрет обхода не даёт роботу прочитать страницу, а значит и указание,
которое на ней написано. Мы наступили на это своим английским разделом:
удалили /en/, поставили переадресацию, но обход был запрещён в
robots.txt. Робот переадресации не увидел, и за три месяца Search Console
насчитала по /en/ 113 показов удалённого раздела.
То же относится и к ИИ-агентам. Запрет обхода и запрет использования это разные вещи, и первый иногда мешает донести второй. Подробнее про устройство файла и что мы в нём оставили, разобрали построчно.
Что мы сделали у себя
В нашем robots.txt нет ни одной строки про ИИ-агентов. Закрыт только
служебный периметр: админка, кабинет и /api/. Это осознанная позиция,
а не упущение: мы хотим попадать в ответы ИИ-поиска со ссылкой, а обучение
на открытом тексте считаем ценой присутствия.
Если вы решаете иначе, решайте по функциям, а не по списку имён. Закрывать обучающие агенты и оставлять поисковые это внятная позиция. Закрывать всё подряд означает исчезнуть из ответов и при этом не помешать тем, кто вас не спрашивал.
Коротко
Двенадцать имён делятся на три задачи: обучение, ответ на вопрос человека,
поисковый индекс. Google-Extended управляет только обучением Gemini и не
влияет на поиск. Applebot-Extended вообще ничего не обходит, это
управляющий токен. Агенты с окончанием -User приходят потому, что человек
задал вопрос. И главное: robots.txt работает только с теми, кто
представляется, а по нашему замеру 589 из 609 роботных визитов выглядели
как обычный Chrome.
