Перейти к содержимому
SEO/Опубликовано 16 сентября 2026 г./5 мин

ИИ-краулеры: двенадцать агентов и что каждый делает

Разбор по официальной документации: GPTBot, ClaudeBot, Google-Extended и ещё девять. Три разные задачи вместо одной, почему Google-Extended не влияет на поиск и чего robots.txt не может в принципе.

ИИ-краулеры: двенадцать агентов и что каждый делает
С
Команда NEXFORCE
SEO-эксперт NEXFORCE

Про ИИ-краулеров обычно пишут списком: вот двенадцать агентов, вот строки для robots.txt. Список без разбора бесполезен, потому что агенты решают три разные задачи, и запрет каждой стоит вам разного.

Ниже разбор по официальной документации владельцев, а не по чужим обзорам.

Три задачи, которые путают в одну

Обучение. Агент собирает содержимое, которое может попасть в обучающую выборку модели. Прямой пользы сайту нет, отложенная спорна.

Ответ на вопрос пользователя. Агент заходит на страницу, потому что человек прямо сейчас что-то спросил и ответ требует посмотреть источник. Это не обход, это переход по вашей ссылке, инициированный человеком.

Поисковый индекс ИИ-поиска. Агент собирает содержимое, чтобы показывать сайт в ответах со ссылкой. Это ближайший аналог обычного поискового робота.

Запрет первого и запрет третьего дают противоположные результаты: первый ничего вам не стоит, третий убирает из ответов вместе со ссылкой.

OpenAI: четыре агента

По документации OpenAI для владельцев сайтов:

GPTBot обходит содержимое, которое может использоваться при обучении базовых генеративных моделей.

OAI-SearchBot показывает сайты в результатах поиска ChatGPT.

ChatGPT-User используется для отдельных действий пользователя в ChatGPT и пользовательских GPT; документация прямо оговаривает, что для автоматического обхода он не применяется.

OAI-AdsBot проверяет безопасность страниц, поданных как реклама в ChatGPT.

Anthropic: три агента

По справке Anthropic:

ClaudeBot собирает содержимое, которое может участвовать в обучении моделей.

Claude-User заходит на сайт, когда пользователь задал вопрос Claude.

Claude-SearchBot анализирует содержимое, чтобы повысить качество и точность поисковых ответов.

Google: два токена, и один из них часто понимают неверно

Google-Extended управляет только тем, может ли содержимое использоваться при обучении моделей Gemini и связанных с ними возможностей. Документация Google говорит об этом прямо: на попадание в поиск и на ранжирование он не влияет.

Это главное недоразумение темы. Запрет Google-Extended не убирает сайт из поиска и не понижает его. И наоборот, разрешение не добавляет видимости.

GoogleOther собирает общедоступное содержимое для разных продуктовых команд, не относясь ни к какому одному продукту.

Perplexity: два агента

PerplexityBot показывает и связывает сайты в результатах Perplexity; для обучения моделей он, по документации, не используется.

Perplexity-User заходит на страницу, когда пользователь задал вопрос и ответ требует посмотреть источник.

Apple и Common Crawl

Applebot обходит сайты для поиска в Spotlight, Siri и Safari. Applebot-Extended ничего не обходит: это управляющий токен, которым издатель отказывается от использования содержимого при обучении моделей Apple.

CCBot собирает открытый набор данных Common Crawl, которым пользуются исследователи и третьи стороны. Представляется он строкой CCBot/2.0 (https://commoncrawl.org/faq/), а список его адресов публикуется отдельным файлом для сверки.

Чего robots.txt не может

Здесь заканчивается документация и начинается наш замер.

robots.txt это просьба, а не забор. Её соблюдают те, кто хочет соблюдать, и не видят те, кто не представляется.

Мы разбирали свой счётчик за три месяца: из 909 визитов 609 роботные, и из этих 609 589 представлялись обычным Google Chrome, почти все прямыми заходами. По браузеру и источнику они неотличимы от человека. Полный разбор с числами выложили отдельно.

Отсюда простое следствие: строки в robots.txt управляют поведением тех агентов, которые называют себя честно. Ровно тех, чей обход обычно и не вреден.

Почему запрет обхода бывает дороже разрешения

И вторая наша находка, уже про сам механизм запрета.

Запрет обхода не даёт роботу прочитать страницу, а значит и указание, которое на ней написано. Мы наступили на это своим английским разделом: удалили /en/, поставили переадресацию, но обход был запрещён в robots.txt. Робот переадресации не увидел, и за три месяца Search Console насчитала по /en/ 113 показов удалённого раздела.

То же относится и к ИИ-агентам. Запрет обхода и запрет использования это разные вещи, и первый иногда мешает донести второй. Подробнее про устройство файла и что мы в нём оставили, разобрали построчно.

Что мы сделали у себя

В нашем robots.txt нет ни одной строки про ИИ-агентов. Закрыт только служебный периметр: админка, кабинет и /api/. Это осознанная позиция, а не упущение: мы хотим попадать в ответы ИИ-поиска со ссылкой, а обучение на открытом тексте считаем ценой присутствия.

Если вы решаете иначе, решайте по функциям, а не по списку имён. Закрывать обучающие агенты и оставлять поисковые это внятная позиция. Закрывать всё подряд означает исчезнуть из ответов и при этом не помешать тем, кто вас не спрашивал.

Коротко

Двенадцать имён делятся на три задачи: обучение, ответ на вопрос человека, поисковый индекс. Google-Extended управляет только обучением Gemini и не влияет на поиск. Applebot-Extended вообще ничего не обходит, это управляющий токен. Агенты с окончанием -User приходят потому, что человек задал вопрос. И главное: robots.txt работает только с теми, кто представляется, а по нашему замеру 589 из 609 роботных визитов выглядели как обычный Chrome.

Вопросы и ответы

FAQ по теме

Влияет ли Google-Extended на позиции в поиске?+
Нет. По документации Google это отдельный токен, которым издатель управляет только тем, может ли содержимое использоваться для обучения моделей Gemini. На попадание в поиск и на ранжирование он не влияет.
Чем ChatGPT-User отличается от GPTBot?+
GPTBot обходит сайты для обучения моделей. ChatGPT-User заходит на страницу тогда, когда человек задал вопрос и ответ требует посмотреть источник. Это не автоматический обход, а действие по запросу пользователя, и запрет его закрывает доступ человеку, а не сборщику данных.
Закроет ли robots.txt сайт от нейросетей?+
Только от тех, кто его читает и соблюдает. Это просьба, а не забор. По нашему собственному замеру 589 из 609 роботных визитов представлялись обычным Google Chrome, то есть не называли себя вовсе.
Что делает Applebot-Extended?+
Ничего не обходит. Это управляющий токен: им издатель отказывается от использования своего содержимого для обучения моделей Apple, а сам обход выполняет Applebot.