Про индексацию обычно пишут в порядке страшности: сначала noindex, потом
Disallow, потом всё остальное. Мы решили выстроить список в порядке
частоты — по тому, что действительно встречается.
Взяли 264 домена компаний Екатеринбурга из своего рабочего списка, прогнали каждый по одинаковому набору проверок и посчитали, сколько раз встретилась каждая поломка. Замер 19 сентября 2026 года.
Сначала о том, сколько сайтов вообще живо
| Состояние | Сайтов |
|---|---|
| домен не отвечает в DNS | 50 |
| резолвится, но не открылся | 6 |
| открылся с кодом не 200 | 13 |
| живая главная, код 200 | 196 |
Пятая часть списка — мёртвые домены. Это не про индексацию, но полезно знать заранее: любая выборка «компании города» на деле меньше, чем выглядит.
Из тринадцати ответивших с ошибкой восемь отдали 403 — доступ закрыт, в том числе для роботов.
Пять поломок по частоте
Считаем от 196 живых сайтов.
| Место | Что не так | Сайтов | Доля |
|---|---|---|---|
| 1 | нет тега canonical на главной | 76 | 38,8% |
| 2 | главная открывается по нескольким адресам без склейки | 61 | 31,1% |
| 3 | карты сайта нет ни по /sitemap.xml, ни в robots.txt | 38 | 19,4% |
| 4 | robots.txt отсутствует или отдаётся как HTML-страница | 14 | 7,1% |
| 5 | прямой запрет индексации | 4 | 2,0% |
Порядок обратный тому, как об этом принято рассказывать. Прямой запрет — последнее место, четыре случая из 196. А первые два места занимают вещи, которые никто не считает поломкой, потому что при них всё работает и выглядит нормально.
Шестым пунктом идёт мелочь, которая тоже стоит внимания: пустой или
отсутствующий <title> — пять раз.
Хотя бы одно замечание нашлось у 112 адресов из 196. Полностью чистых — 84.
Первое место: нет canonical
Тег <link rel="canonical"> говорит поисковику, какой адрес страницы
считать основным. Его нет в 76 случаях — почти у сорока процентов.
Сам по себе отсутствующий canonical страницу из индекса не выкидывает. Опасен он в паре со вторым пунктом: когда одна и та же страница доступна по нескольким адресам и ни один из них не назван главным, выбор делает робот. Иногда он выбирает не тот.
Второе место: главная по четырём адресам сразу
Мы запрашивали главную по четырём вариантам — с www и без, по http и
https — и смотрели, ведут ли они на один и тот же конечный адрес.
| Сколько лишних адресов отдают 200 | Сайтов |
|---|---|
| ни одного, всё склеено | 135 |
| один | 15 |
| два | 36 |
| три | 10 |
В выборке у 61 сайта склейки нет полностью или частично. У десяти главная честно открывается по всем четырём адресам, и каждый отдаёт код 200 без перенаправления.
Для поисковика это четыре разных сайта с одинаковым содержимым. Он их объединит, скорее всего сам, но какой адрес станет основным — решит не владелец. Заодно расходуется обход: робот тратит визиты на четыре копии вместо одной.
Лечится одной строкой в настройках сервера: все лишние адреса отдают 301 на один выбранный.
Третье место: карты сайта нет
Ни файла /sitemap.xml, ни строки Sitemap: в robots.txt — 38 раз,
почти у каждого пятого.
Без карты робот узнаёт о страницах только по ссылкам. Для визитки это переживаемо: десяток страниц он обойдёт и так. Для каталога с сотнями карточек — прямая потеря: глубокие страницы могут не попасть в обход годами.
Четвёртое место: robots.txt, которого нет или который не robots.txt
Файла нет в 10 случаях. Ещё в четырёх он есть, но отдаёт HTML-страницу — обычно «404», которую сервер подставляет вместо любого отсутствующего файла.
Второй случай хуже первого. Отсутствие файла робот трактует однозначно: запретов нет. А HTML вместо директив он разбирает как умеет, и результат непредсказуем.
Пятое место: прямой запрет
Четыре компании из 196 закрыты от поиска целиком, и способы разные:
- две мебельные компании —
noindexв мета-теге, у одной ещё и в заголовке ответа сервера; - одна стоматология —
Disallow: /в robots.txt при разрешающем мета-теге; - одна юридическая фирма —
noindexв мета-теге.
Третий случай показателен: в коде страницы стоит index, follow, и на
беглый взгляд всё в порядке. Запрет живёт в другом файле. Про все четыре
места, где он может прятаться, у нас есть
отдельный разбор с порядком проверки.
Чего этот замер не говорит
Проверялась только главная и только техническая сторона. Мы не смотрели, что происходит с внутренними страницами, сколько их в индексе на самом деле и почему. Поисковик может исключить страницу, у которой формально всё в порядке, — по малоценности, по дублю содержимого, по качеству.
И отдельно про отказы. В первом прогоне «не открылись» 77 адресов. Прежде чем
записывать их в мёртвые, мы проверили причину — и 19 ожили после
исправления нашего собственного скрипта: он не умел переводить
кириллические домены в punycode и не пробовал http, если https не
отвечал. Четверть «мёртвых» сайтов была нашей ошибкой.
Это общее правило, и оно дороже любого пункта выше: отказ проверки — не находка про чужой сайт, пока не выяснена причина отказа.
Как проверить свой сайт за пять минут
- Открыть главную по четырём адресам:
http://site.ru,https://site.ru,http://www.site.ru,https://www.site.ru. Все должны привести на один. - Запросить
/robots.txt. Ответ — текст с директивами, а не страница сайта. - Запросить
/sitemap.xml. Ответ — XML, а не 404. - Найти в коде главной
rel="canonical"иname="robots". - Посмотреть заголовки ответа сервера на
X-Robots-Tag.
Ни один пункт не требует платных инструментов, и все пять закрывают то, что встречается чаще всего.
Коротко
На 196 живых главных страницах прямой запрет индексации встретился 4 раза, а несклеенные адреса — 61 раз. Самое частое, что мешает поисковику, — не запрет, а неоднозначность: непонятно, какой адрес главный, и нет карты, по которой обойти остальное. Чистыми по всем проверкам оказались 84 из 196.
