Перейти к содержимому
SEO/Опубликовано 21 сентября 2026 г./5 мин

Что чаще всего ломает индексацию: обход 264 сайтов

Прогнали 264 сайта Екатеринбурга по проверкам, от которых зависит попадание в индекс, и выстроили поломки по частоте. Самая частая — не запрет в robots.txt, а несклеенные адреса главной: 31% живых сайтов.

Что чаще всего ломает индексацию: обход 264 сайтов
С
Команда NEXFORCE
SEO-эксперт NEXFORCE

Про индексацию обычно пишут в порядке страшности: сначала noindex, потом Disallow, потом всё остальное. Мы решили выстроить список в порядке частоты — по тому, что действительно встречается.

Взяли 264 домена компаний Екатеринбурга из своего рабочего списка, прогнали каждый по одинаковому набору проверок и посчитали, сколько раз встретилась каждая поломка. Замер 19 сентября 2026 года.

Сначала о том, сколько сайтов вообще живо

СостояниеСайтов
домен не отвечает в DNS50
резолвится, но не открылся6
открылся с кодом не 20013
живая главная, код 200196

Пятая часть списка — мёртвые домены. Это не про индексацию, но полезно знать заранее: любая выборка «компании города» на деле меньше, чем выглядит.

Из тринадцати ответивших с ошибкой восемь отдали 403 — доступ закрыт, в том числе для роботов.

Пять поломок по частоте

Считаем от 196 живых сайтов.

МестоЧто не такСайтовДоля
1нет тега canonical на главной7638,8%
2главная открывается по нескольким адресам без склейки6131,1%
3карты сайта нет ни по /sitemap.xml, ни в robots.txt3819,4%
4robots.txt отсутствует или отдаётся как HTML-страница147,1%
5прямой запрет индексации42,0%

Порядок обратный тому, как об этом принято рассказывать. Прямой запрет — последнее место, четыре случая из 196. А первые два места занимают вещи, которые никто не считает поломкой, потому что при них всё работает и выглядит нормально.

Шестым пунктом идёт мелочь, которая тоже стоит внимания: пустой или отсутствующий <title> — пять раз.

Хотя бы одно замечание нашлось у 112 адресов из 196. Полностью чистых — 84.

Первое место: нет canonical

Тег <link rel="canonical"> говорит поисковику, какой адрес страницы считать основным. Его нет в 76 случаях — почти у сорока процентов.

Сам по себе отсутствующий canonical страницу из индекса не выкидывает. Опасен он в паре со вторым пунктом: когда одна и та же страница доступна по нескольким адресам и ни один из них не назван главным, выбор делает робот. Иногда он выбирает не тот.

Второе место: главная по четырём адресам сразу

Мы запрашивали главную по четырём вариантам — с www и без, по http и https — и смотрели, ведут ли они на один и тот же конечный адрес.

Сколько лишних адресов отдают 200Сайтов
ни одного, всё склеено135
один15
два36
три10

В выборке у 61 сайта склейки нет полностью или частично. У десяти главная честно открывается по всем четырём адресам, и каждый отдаёт код 200 без перенаправления.

Для поисковика это четыре разных сайта с одинаковым содержимым. Он их объединит, скорее всего сам, но какой адрес станет основным — решит не владелец. Заодно расходуется обход: робот тратит визиты на четыре копии вместо одной.

Лечится одной строкой в настройках сервера: все лишние адреса отдают 301 на один выбранный.

Третье место: карты сайта нет

Ни файла /sitemap.xml, ни строки Sitemap: в robots.txt — 38 раз, почти у каждого пятого.

Без карты робот узнаёт о страницах только по ссылкам. Для визитки это переживаемо: десяток страниц он обойдёт и так. Для каталога с сотнями карточек — прямая потеря: глубокие страницы могут не попасть в обход годами.

Четвёртое место: robots.txt, которого нет или который не robots.txt

Файла нет в 10 случаях. Ещё в четырёх он есть, но отдаёт HTML-страницу — обычно «404», которую сервер подставляет вместо любого отсутствующего файла.

Второй случай хуже первого. Отсутствие файла робот трактует однозначно: запретов нет. А HTML вместо директив он разбирает как умеет, и результат непредсказуем.

Пятое место: прямой запрет

Четыре компании из 196 закрыты от поиска целиком, и способы разные:

  • две мебельные компании — noindex в мета-теге, у одной ещё и в заголовке ответа сервера;
  • одна стоматология — Disallow: / в robots.txt при разрешающем мета-теге;
  • одна юридическая фирма — noindex в мета-теге.

Третий случай показателен: в коде страницы стоит index, follow, и на беглый взгляд всё в порядке. Запрет живёт в другом файле. Про все четыре места, где он может прятаться, у нас есть отдельный разбор с порядком проверки.

Чего этот замер не говорит

Проверялась только главная и только техническая сторона. Мы не смотрели, что происходит с внутренними страницами, сколько их в индексе на самом деле и почему. Поисковик может исключить страницу, у которой формально всё в порядке, — по малоценности, по дублю содержимого, по качеству.

И отдельно про отказы. В первом прогоне «не открылись» 77 адресов. Прежде чем записывать их в мёртвые, мы проверили причину — и 19 ожили после исправления нашего собственного скрипта: он не умел переводить кириллические домены в punycode и не пробовал http, если https не отвечал. Четверть «мёртвых» сайтов была нашей ошибкой.

Это общее правило, и оно дороже любого пункта выше: отказ проверки — не находка про чужой сайт, пока не выяснена причина отказа.

Как проверить свой сайт за пять минут

  • Открыть главную по четырём адресам: http://site.ru, https://site.ru, http://www.site.ru, https://www.site.ru. Все должны привести на один.
  • Запросить /robots.txt. Ответ — текст с директивами, а не страница сайта.
  • Запросить /sitemap.xml. Ответ — XML, а не 404.
  • Найти в коде главной rel="canonical" и name="robots".
  • Посмотреть заголовки ответа сервера на X-Robots-Tag.

Ни один пункт не требует платных инструментов, и все пять закрывают то, что встречается чаще всего.

Коротко

На 196 живых главных страницах прямой запрет индексации встретился 4 раза, а несклеенные адреса — 61 раз. Самое частое, что мешает поисковику, — не запрет, а неоднозначность: непонятно, какой адрес главный, и нет карты, по которой обойти остальное. Чистыми по всем проверкам оказались 84 из 196.

Вопросы и ответы

FAQ по теме

Что чаще всего мешает попасть в индекс?+
По нашей проверке 264 сайтов Екатеринбурга — не запреты, а дубли главной страницы: у 31% живых сайтов главная открывается сразу по нескольким адресам без склейки. Прямой запрет индексации нашёлся только у четырёх сайтов из 196.
Опасно ли, что сайт открывается и с www, и без?+
Опасно, если оба адреса отдают код 200 и не перенаправляют один на другой. Тогда поисковик видит два разных сайта с одинаковым содержимым и сам решает, какой показывать. Правильно — один рабочий адрес, остальные отдают 301.
Обязательна ли карта сайта?+
Формально нет, но без неё робот узнаёт о страницах только по ссылкам. У 19% проверенных сайтов карты нет ни по адресу /sitemap.xml, ни в robots.txt. Для сайта из десятка страниц это терпимо, для каталога — нет.
Нужен ли canonical на главной странице?+
Нужен, и это самая частая недоделка: тега нет у 39% проверенных сайтов. Он указывает, какой адрес считать основным, и снимает половину вопросов с дублями.
Как быстро проверить свой сайт по этим пунктам?+
Открыть главную по четырём адресам (с www и без, по http и https) и посмотреть, все ли ведут на один; запросить /robots.txt и /sitemap.xml; найти в коде страницы теги canonical и robots. Пять минут без единого платного инструмента.