Перейти к содержимому
Бесплатная проверка · без регистрации

Проверить robots.txt сайта

robots.txt — первый файл, который читает робот. Одна лишняя строка в нём убирает из поиска весь сайт, и происходит это тихо: страницы остаются доступными людям, отдают код 200 и просто перестают появляться в выдаче.

Ответ на этой же странице, без почты и звонка

Введите адрес — проверка займёт от трёх до тридцати секунд.

точка — страница из карты сайта

Команда NEXFORCE·SEO-специалистыОпубликовано Проверено
Что проверяем

Что именно смотрит проверка

  • —Есть ли robots.txt и отдаётся ли он кодом 200
  • —Нет ли запрета на весь сайт — самая дорогая ошибка из возможных
  • —Что закрыто и нет ли среди этого нужных разделов
  • —Указан ли адрес карты сайта
  • —Метатег robots и заголовок X-Robots-Tag на страницах: нет ли noindex там, где он не нужен
  • —Не противоречат ли друг другу robots.txt, метатег и canonical
Зачем

Почему это влияет на поиск

Закрытая по ошибке страница не сообщает об этом

Ни в браузере, ни в отчётах по трафику это не видно: страница открывается, ссылки работают, просто из поиска она исчезает. Обычно такое находят через месяцы и по косвенным признакам — по провалу трафика в разделе.

Запрет в robots.txt и noindex — разные вещи

Запрет в robots.txt не пускает робота на страницу, поэтому он не может прочитать стоящий на ней noindex. Адрес при этом остаётся известным по ссылкам и иногда попадает в выдачу без описания. Чтобы убрать страницу из поиска, нужен именно noindex при открытом доступе.

Служебные разделы стоит закрывать не только ради индексации

Поиск по сайту, корзина, личный кабинет и страницы фильтров плодят бесконечные адреса. Они не попадут в выдачу и без запрета, но потратят обход, которого не хватит настоящим страницам. У нас это видно на цифрах: девять десятых дневного обхода однажды ушло в раздел, который поиск всё равно не берёт.

Проверка

Введите адрес — покажем за 30 секунд

Без регистрации. Проверка идёт по этой странице сайта и заодно показывает остальные заметные ошибки, если они есть.

Из практики

Что обычно находим по этой проверке

Запрет на весь сайт, приехавший с тестового сервера

Самая дорогая строка из возможных. На тесте она стояла по делу, при переносе про неё забыли, и сайт месяцами не появляется в выдаче при полностью рабочем содержимом.

Страница закрыта в robots.txt и помечена noindex

Взаимоисключающая пара: робота не пускают на страницу, поэтому прочитать noindex он не может. Адрес остаётся в выдаче без описания.

Карта сайта в robots.txt не указана

Мелочь, которая стоит времени: карту приходится добавлять руками в каждую панель вебмастера, а при смене адреса — вспоминать об этом снова.

Что делать дальше

Как чинить то, что нашлось

Проверять после каждого переноса сайта

Запрет на весь сайт чаще всего приезжает с тестового сервера: там он стоит по делу, а при переносе про него забывают. Это первое, что стоит смотреть после запуска новой версии.

Закрывать точечно, а не разделами

Широкий запрет вида «всё, что содержит параметр» однажды закроет нужное. Лучше перечислить конкретные служебные пути и не трогать остальное.

Сверять три источника разом

robots.txt, метатег robots и canonical должны говорить одно и то же. Противоречие между ними — частая причина, по которой страница месяцами не заходит в поиск при полностью здоровом содержимом.

Если чинить некому или непонятно, с чего начинать, — это и есть наша работа: SEO-продвижение сайта, а сколько это стоит — на странице стоимость продвижения.

FAQ

Вопросы про robots.txt

Для тестовой версии — запретом в robots.txt и обязательно закрытием доступа паролем: robots.txt носит рекомендательный характер и не защищает от чужих глаз. Для отдельной страницы боевого сайта — метатегом noindex при открытом доступе для робота, иначе он не сможет его прочитать.

Обычно да, но не всегда: если по сочетанию фильтров есть настоящий спрос, такая страница может быть полезной и её лучше открыть и уникализировать. Правило простое — открываем то, что отвечает на реальный запрос, закрываем то, что плодит одинаковые адреса.

Потому что запрет в robots.txt закрывает обход, а не индексацию. Если на страницу ссылаются, поисковая система может показать её адрес без описания — прочитать содержимое и увидеть запрет она не имеет права. Убирается это открытием доступа и метатегом noindex.

Подробно

Файл robots.txt: что в нём пишут и где ошибаются

Файл robots txt лежит в корне сайта и говорит поисковым роботам, какие адреса обходить не нужно. Это единственный файл, где одной строкой можно закрыть от поиска весь сайт целиком, — поэтому ошибки в нём стоят дороже, чем в любом другом месте технической части.

Что робот читает и в каком порядке

Правила группируются по User-agent — имени робота. Группа для Yandex, группа для Googlebot, группа со звёздочкой для всех остальных. Робот выбирает одну группу, самую подходящую именно ему, и остальные не читает вовсе. Отсюда типовой промах: правила дописали в общую секцию, а у Яндекса своя выше — и новых строк он просто не увидел.

Внутри группы Disallow запрещает обход, Allow разрешает исключение из запрета. Побеждает не порядок строк, а длина правила: более длинное и конкретное перекрывает более короткое.

Чего этот файл не делает

Здесь путаются чаще всего. Запрет обхода — это не запрет показа. Страница, закрытая в robots.txt, может попасть в выдачу без текста и описания: система знает адрес по ссылкам с других сайтов, но зайти и прочитать не может. Убирать страницу из поиска нужно мета-тегом noindex, а для этого робот обязан страницу прочитать — то есть в файле robots txt она закрыта быть не должна.

Отсюда вечная ловушка: закрыли раздел от обхода, чтобы он ушёл из поиска, — и он остался там навсегда, потому что робот больше не видит запрета внутри страницы.

Закрыли в robots.txt

  1. 1Робот не заходит на страницу
  2. 2Содержимое не прочитано
  3. 3Запрет внутри страницы не виден

Страница может остаться в выдаче — без описания, по ссылкам с других сайтов

Оставили открытой, поставили noindex

  1. 1Робот заходит на страницу
  2. 2Читает содержимое
  3. 3Видит запрет индексации

Страница уходит из выдачи — именно так, как и требовалось

Обе дорожки начинаются с одного намерения — убрать страницу из поиска, — но приводят к противоположному. Запрет в robots.txt лишает поисковую систему возможности прочитать ваш же запрет индексации.

Ещё файл robots txt не защищает данные. Файл открыт всем, и перечислять в нём адреса административных разделов — значит выкладывать их список публично.

Директивы, о которых забывают

Sitemap — полный адрес карты сайта, пишется отдельной строкой вне групп и относится ко всем роботам сразу. Без неё робот найдёт карту не сразу или не найдёт вовсе.

Clean-param — только для Яндекса, и это самое полезное, что есть в файле для интернет-магазина. Она сообщает, какие параметры адреса не меняют содержимое: метки рекламных кампаний, идентификаторы сессий, сортировки. Без неё один товар попадает в индекс десятком адресов и размывает релевантность.

Crawl-delay давно не поддерживается ни Яндексом, ни Google — скорость обхода настраивается в панели вебмастера. Строка в файле остаётся, но ни на что не влияет.

Что обычно находится при проверке

Полный запрет всего сайта, оставшийся с разработки, — самая дорогая ошибка: сайт неделями не в индексе, а внешне всё исправно. Дальше по частоте: отсутствие строки с картой сайта; закрытые от обхода папки со стилями и скриптами, из-за чего система видит страницу нерабочей на телефоне; правила для несуществующего робота из-за опечатки в имени.

Отдельный случай — файл, отдающий не тот код ответа. Если по адресу вместо файла приходит страница ошибки с кодом 200, робот считает её содержимым и пытается разобрать как правила.

Как ведётся проверка robots txt

Проверка robots txt у нас показывает, что в файле есть, какие разделы закрыты и не закрыто ли лишнее, — сразу по адресу сайта. Дальше стоит свериться с валидаторами поисковых систем: у Яндекса и Google свои особенности разбора, и файл имеет смысл прогнать в обоих. Заодно посмотрите карту сайта в паре с robots txt: эти два файла работают вместе, и толку от одного без другого мало. Что ещё мешает индексации, показывает аудит, куда входит и robots txt.