Страница не в поиске — и первым делом смотрят robots.txt. Между тем запрет живёт в четырёх разных местах, и достаточно одного. Наш движок ходит по всем четырём; вот что мы увидели, пройдя ими по живым площадкам.
Четыре места, где живёт запрет
| Где | Как выглядит | Видно ли в коде страницы |
|---|---|---|
Метатег robots | <meta name="robots" content="noindex"> | да |
Метатег yandex | <meta name="yandex" content="noindex"> | да |
Заголовок X-Robots-Tag | приходит от сервера в ответе | нет |
robots.txt | Disallow: для раздела или всего сайта | нет, лежит отдельным файлом |
Третья строка — самая коварная. Заголовок X-Robots-Tag не попадает в исходный
код: открыв «просмотр кода страницы», вы его не увидите. Его ставят на уровне
сервера или CDN, и он переживает любую правку шаблона.
Отдельно стоит помнить, что robots.txt запрещает обход, а не показ: адрес,
закрытый там, может остаться в выдаче со служебным описанием. Разбор каждой
директивы, включая Clean-param, у нас отдельно.
Замер: 186 живых сайтов
7 сентября 2026 года мы прошли теми же четырьмя проверками по сайтам компаний Екатеринбурга. Открылись 186.
Оговорка про остальные: замер шёл с европейского адреса, а часть российских сайтов такие адреса не пускает. Перепроверка молчавших через российский выход дала шесть успешных ответов — значит небольшая часть «не открылись» была нашей географией. На выводы это не влияет: запреты мы считали среди тех, кто ответил.
| Что нашли | Сайтов |
|---|---|
noindex в метатеге robots | 2 |
noindex в заголовке X-Robots-Tag | 1 |
robots.txt закрывает весь сайт всем роботам | 1 |
robots.txt отдаётся, но как HTML-страница | 3 |
robots.txt отдаётся нормально | 174 |
| В нём указана карта сайта | 149 |
Запретов мало, и это ожидаемо: закрытая от поиска площадка долго не живёт. Интереснее разобрать те, что нашлись.
Стоматология, закрытая целиком. Файл из двух строк: User-agent: * и
Disallow: /. Это запрет обхода всего сайта для всех роботов сразу. Так
закрывают площадку на время разработки — и забывают открыть.
Мебельный поддомен с noindex, noarchive. Региональная версия сети
закрыта метатегом. Возможно, намеренно: региональные поддомены иногда
специально держат вне индекса. Отличить умысел от забытой строки снаружи
нельзя — и в этом главная сложность таких проверок.
Страница защиты вместо главной. Ещё один домен ответил нашему агенту
антибот-заглушкой, и на ней стояли и noindex в метатеге, и X-Robots-Tag.
Сама площадка, возможно, открыта. Но робот на первом заходе увидит ровно то же,
что увидели мы.
robots.txt, которого нет как файла
Три площадки отдают по адресу /robots.txt HTML-страницу — обычно это
«страница не найдена», настроенная отвечать кодом 200. Для робота это не
правила, а мусор: файла с директивами фактически нет.
Отдельная цифра: карта указана в файле у 149 площадок из 174. У остальных робот ищет её сам и находит не всегда.
Что стоит у нас
Мы прогнали проверку по себе тем же способом. robots.txt открыт: Allow: /
и один закрытый служебный раздел. Заголовка X-Robots-Tag нет. Метатег
robots стоит со значением index, follow — и это ровно тот случай, о котором
стоит сказать честно: значение бессмысленное, оно повторяет поведение по
умолчанию. Из 186 проверенных так делают 22, включая нас.
Как проверить все четыре места за минуту
Проверка не требует ничего, кроме командной строки. Ниже — по одной команде на каждое место, где живёт запрет.
Метатеги на странице. Смотрим не глазами в браузере, а в том, что отдал сервер: скрипт может дорисовать что угодно позже.
curl -s https://адрес/страница/ | grep -oiE '<meta[^>]+name="(robots|yandex)"[^>]*>'
Заголовок ответа. Его в коде страницы не видно вообще — только так:
curl -sI https://адрес/страница/ | grep -i x-robots-tag
Пустой ответ здесь — хорошая новость: заголовка нет.
robots.txt и код ответа страницы.
curl -s https://адрес/robots.txt | head -20
curl -s -o /dev/null -w "%{http_code}\n" https://адрес/страница/
У robots.txt важно посмотреть не только правила, но и то, что это вообще
текстовый файл: три площадки из нашего замера отдают по этому адресу
HTML-страницу с кодом 200, и робот получает не правила, а разметку.
Что делать с каждым исходом
| Что нашли | Что это значит | Что делать |
|---|---|---|
noindex в метатеге | страница закрыта намеренно или по забывчивости шаблона | снять, если закрытие не было решением; проверить весь шаблон, а не одну страницу |
noindex в X-Robots-Tag | закрытие стоит на уровне сервера или CDN | искать в конфигурации, правка шаблона его не снимет |
Disallow на раздел | робот не обойдёт адрес, но может показать его без описания | если раздел нужен в поиске — убрать правило; закрывать надо через noindex на странице |
robots.txt отдаётся как HTML | правил у сайта фактически нет | отдавать текстовый файл; проверить, что 404 не подменяет его кодом 200 |
| Запретов нет, страницы нет | дело не в запрете | смотреть входящие ссылки и возраст |
Две строки здесь стоит перечитать вместе. Disallow и noindex решают разные
задачи: первый запрещает обход, второй — показ. Закрытая в robots.txt
страница может остаться в выдаче со служебным описанием, потому что робот не
зашёл на неё и не увидел запрета показа. И наоборот: noindex на странице,
закрытой в robots.txt, не сработает никогда — робот его просто не прочитает.
Что мы видели в чужих метатегах
Из 186 площадок метатег robots вообще есть у 63, и половина значений в нём
ничего не делает:
| Значение | Площадок |
|---|---|
index, follow | 22 |
index, follow, max-image-preview:large… | 17 |
max-image-preview:large | 8 |
all | 6 |
noyaca | 3 |
noindex, noarchive | 1 |
index, follow и all повторяют поведение по умолчанию — это 28 площадок из
63, которые написали то, что и так работает. А вот max-image-preview:large,
который встретился 29 раз в разных сочетаниях, работу делает: он разрешает
крупное превью картинки в выдаче. Редкий noyaca — запрет Яндексу брать
описание из Яндекс.Каталога, наследство тех времён, когда каталог существовал.
Порядок проверки, когда страницы нет в поиске
- Код ответа — страница должна отдавать 200, а не редирект и не ошибку.
- Четыре места запрета — метатеги
robotsиyandex, заголовокX-Robots-Tag,robots.txt. - Canonical — не указывает ли страница на другую как на основную.
- Входящие ссылки — на адрес, куда никто не ссылается, робот приходит неохотно: мы измеряли это на себе.
- Возраст — если запретов нет, чаще всего дело во времени, а не в тексте.
Пройти первые четыре шага автоматически можно проверкой индексации: она смотрит все места сразу и показывает, какое именно сработало.
Коротко
Запрет живёт в четырёх местах, и X-Robots-Tag не виден в коде страницы. На
186 живых площадках запретов нашлось четыре, зато три отдают robots.txt как
HTML-страницу, а 25 не указали в нём карту. Прежде чем дописывать тексты на
непроиндексированную страницу, стоит убедиться, что её вообще пускают в
индекс.
