Перейти к содержимому
SEO/Опубликовано 7 сентября 2026 г./5 мин

Индексация: что мешает роботу и как это увидеть

Запрет индексации живёт в четырёх местах, и достаточно одного. Проверили 186 живых сайтов Екатеринбурга: одна стоматология закрыта от всех роботов целиком, у трёх robots.txt отдаётся как HTML-страница.

Индексация: что мешает роботу и как это увидеть
С
Команда NEXFORCE
SEO-эксперт NEXFORCE

Страница не в поиске — и первым делом смотрят robots.txt. Между тем запрет живёт в четырёх разных местах, и достаточно одного. Наш движок ходит по всем четырём; вот что мы увидели, пройдя ими по живым площадкам.

Четыре места, где живёт запрет

ГдеКак выглядитВидно ли в коде страницы
Метатег robots<meta name="robots" content="noindex">да
Метатег yandex<meta name="yandex" content="noindex">да
Заголовок X-Robots-Tagприходит от сервера в ответенет
robots.txtDisallow: для раздела или всего сайтанет, лежит отдельным файлом

Третья строка — самая коварная. Заголовок X-Robots-Tag не попадает в исходный код: открыв «просмотр кода страницы», вы его не увидите. Его ставят на уровне сервера или CDN, и он переживает любую правку шаблона.

Отдельно стоит помнить, что robots.txt запрещает обход, а не показ: адрес, закрытый там, может остаться в выдаче со служебным описанием. Разбор каждой директивы, включая Clean-param, у нас отдельно.

Замер: 186 живых сайтов

7 сентября 2026 года мы прошли теми же четырьмя проверками по сайтам компаний Екатеринбурга. Открылись 186.

Оговорка про остальные: замер шёл с европейского адреса, а часть российских сайтов такие адреса не пускает. Перепроверка молчавших через российский выход дала шесть успешных ответов — значит небольшая часть «не открылись» была нашей географией. На выводы это не влияет: запреты мы считали среди тех, кто ответил.

Что нашлиСайтов
noindex в метатеге robots2
noindex в заголовке X-Robots-Tag1
robots.txt закрывает весь сайт всем роботам1
robots.txt отдаётся, но как HTML-страница3
robots.txt отдаётся нормально174
В нём указана карта сайта149

Запретов мало, и это ожидаемо: закрытая от поиска площадка долго не живёт. Интереснее разобрать те, что нашлись.

Стоматология, закрытая целиком. Файл из двух строк: User-agent: * и Disallow: /. Это запрет обхода всего сайта для всех роботов сразу. Так закрывают площадку на время разработки — и забывают открыть.

Мебельный поддомен с noindex, noarchive. Региональная версия сети закрыта метатегом. Возможно, намеренно: региональные поддомены иногда специально держат вне индекса. Отличить умысел от забытой строки снаружи нельзя — и в этом главная сложность таких проверок.

Страница защиты вместо главной. Ещё один домен ответил нашему агенту антибот-заглушкой, и на ней стояли и noindex в метатеге, и X-Robots-Tag. Сама площадка, возможно, открыта. Но робот на первом заходе увидит ровно то же, что увидели мы.

robots.txt, которого нет как файла

Три площадки отдают по адресу /robots.txt HTML-страницу — обычно это «страница не найдена», настроенная отвечать кодом 200. Для робота это не правила, а мусор: файла с директивами фактически нет.

Отдельная цифра: карта указана в файле у 149 площадок из 174. У остальных робот ищет её сам и находит не всегда.

Что стоит у нас

Мы прогнали проверку по себе тем же способом. robots.txt открыт: Allow: / и один закрытый служебный раздел. Заголовка X-Robots-Tag нет. Метатег robots стоит со значением index, follow — и это ровно тот случай, о котором стоит сказать честно: значение бессмысленное, оно повторяет поведение по умолчанию. Из 186 проверенных так делают 22, включая нас.

Как проверить все четыре места за минуту

Проверка не требует ничего, кроме командной строки. Ниже — по одной команде на каждое место, где живёт запрет.

Метатеги на странице. Смотрим не глазами в браузере, а в том, что отдал сервер: скрипт может дорисовать что угодно позже.

curl -s https://адрес/страница/ | grep -oiE '<meta[^>]+name="(robots|yandex)"[^>]*>'

Заголовок ответа. Его в коде страницы не видно вообще — только так:

curl -sI https://адрес/страница/ | grep -i x-robots-tag

Пустой ответ здесь — хорошая новость: заголовка нет.

robots.txt и код ответа страницы.

curl -s https://адрес/robots.txt | head -20
curl -s -o /dev/null -w "%{http_code}\n" https://адрес/страница/

У robots.txt важно посмотреть не только правила, но и то, что это вообще текстовый файл: три площадки из нашего замера отдают по этому адресу HTML-страницу с кодом 200, и робот получает не правила, а разметку.

Что делать с каждым исходом

Что нашлиЧто это значитЧто делать
noindex в метатегестраница закрыта намеренно или по забывчивости шаблонаснять, если закрытие не было решением; проверить весь шаблон, а не одну страницу
noindex в X-Robots-Tagзакрытие стоит на уровне сервера или CDNискать в конфигурации, правка шаблона его не снимет
Disallow на разделробот не обойдёт адрес, но может показать его без описанияесли раздел нужен в поиске — убрать правило; закрывать надо через noindex на странице
robots.txt отдаётся как HTMLправил у сайта фактически нетотдавать текстовый файл; проверить, что 404 не подменяет его кодом 200
Запретов нет, страницы нетдело не в запретесмотреть входящие ссылки и возраст

Две строки здесь стоит перечитать вместе. Disallow и noindex решают разные задачи: первый запрещает обход, второй — показ. Закрытая в robots.txt страница может остаться в выдаче со служебным описанием, потому что робот не зашёл на неё и не увидел запрета показа. И наоборот: noindex на странице, закрытой в robots.txt, не сработает никогда — робот его просто не прочитает.

Что мы видели в чужих метатегах

Из 186 площадок метатег robots вообще есть у 63, и половина значений в нём ничего не делает:

ЗначениеПлощадок
index, follow22
index, follow, max-image-preview:large…17
max-image-preview:large8
all6
noyaca3
noindex, noarchive1

index, follow и all повторяют поведение по умолчанию — это 28 площадок из 63, которые написали то, что и так работает. А вот max-image-preview:large, который встретился 29 раз в разных сочетаниях, работу делает: он разрешает крупное превью картинки в выдаче. Редкий noyaca — запрет Яндексу брать описание из Яндекс.Каталога, наследство тех времён, когда каталог существовал.

Порядок проверки, когда страницы нет в поиске

  1. Код ответа — страница должна отдавать 200, а не редирект и не ошибку.
  2. Четыре места запрета — метатеги robots и yandex, заголовок X-Robots-Tag, robots.txt.
  3. Canonical — не указывает ли страница на другую как на основную.
  4. Входящие ссылки — на адрес, куда никто не ссылается, робот приходит неохотно: мы измеряли это на себе.
  5. Возраст — если запретов нет, чаще всего дело во времени, а не в тексте.

Пройти первые четыре шага автоматически можно проверкой индексации: она смотрит все места сразу и показывает, какое именно сработало.

Коротко

Запрет живёт в четырёх местах, и X-Robots-Tag не виден в коде страницы. На 186 живых площадках запретов нашлось четыре, зато три отдают robots.txt как HTML-страницу, а 25 не указали в нём карту. Прежде чем дописывать тексты на непроиндексированную страницу, стоит убедиться, что её вообще пускают в индекс.

Вопросы и ответы

FAQ по теме

Где может стоять запрет индексации?+
В четырёх местах: метатег robots на странице, метатег yandex, заголовок X-Robots-Tag от сервера и robots.txt. Достаточно одного из них, а проверяют обычно только последний.
Чем X-Robots-Tag отличается от метатега?+
Тем, что его не видно в исходном коде страницы: это заголовок ответа сервера. Открыв «просмотр кода», вы его не найдёте — нужно смотреть заголовки ответа.
Что означает «index, follow» в метатеге?+
Ничего сверх поведения по умолчанию: робот и так индексирует страницу и переходит по ссылкам. Из 186 проверенных сайтов такой метатег стоит у 22 — он безвреден, но и бесполезен.
Может ли сайт быть закрыт целиком по ошибке?+
Да, и мы нашли такой случай. У одной стоматологии robots.txt состоит из двух строк: «User-agent: *» и «Disallow: /». Это закрывает от обхода весь сайт для всех роботов.