Индексация — это момент, когда поисковая система не просто узнала адрес страницы, а прочитала её и сочла достойной показа. Между «робот зашёл» и «страница в поиске» лежит целый ряд решений системы, и именно там теряется большинство страниц.
Как проверить индексацию тремя способами
Проверить индексацию точно можно только в панели вебмастера — это единственный источник, где видно причину по каждому адресу. В Яндекс.Вебмастере это раздел «Страницы в поиске», в Google Search Console — «Индексирование страниц». Там же видно и причину исключения по каждому адресу, чего не даёт ни один сторонний сервис.
Оператор site: в строке поиска показывает примерную картину. Число там округлённое и скачет между заходами, поэтому годится для быстрого взгляда, а не для отчёта.
Сравнение с картой сайта отвечает на главный вопрос: сколько адресов вы отдали системе и сколько из них попало в страницы в индексе. Расхождение в разы — повод разбираться, даже если формально ошибок нет.
Почему страницы в индекс не попадают
- 01Робот узнал адресНе узнал: страницы нет в карте сайта и на неё не ведут внутренние ссылки.признак: В Вебмастере страницы нет вовсе — ни в поиске, ни в исключённых.
- 02Робот зашёл на страницуНе зашёл: адрес закрыт в robots.txt или робот тратит обход на мусорные адреса.признак: Статус «обход запрещён» либо страница месяцами «ожидает обхода».
- 03Прочитал содержимоеПрочитал, но увидел запрет индексации или канонический адрес на другую страницу.признак: Статус «исключена по запрету» или «неканоническая».
- 04Решил показыватьНе решил: содержимое дублирует другую страницу или показывать почти нечего.признак: «Обойдена, но не проиндексирована» или пометка о малоценности.
- 05Страница в поискеДошли все четыре шага — страница показывается по запросам.
Первая причина скучная и самая частая: страница слишком новая. Обход занимает от суток до нескольких недель, и у молодого домена дольше. По нашим замерам на собственном сайте самостоятельная страница попадает в индекс Яндекса примерно за двое суток, но это при уже налаженном обходе.
Вторая — дубли. Если система нашла несколько страниц с почти одинаковым содержимым, она выберет одну, а остальные пометит как менее полезные версии. В отчёте это выглядит как «страница обойдена, но не в поиске», и причина там не указана. Проверить свой сайт на это можно проверкой дублей страниц.
Третья — запрет, о котором забыли: закрытие в robots.txt, мета-тег noindex, оставшийся с разработки, канонический адрес, указывающий на другую страницу.
Четвёртая — качество. Страница-заглушка, карточка без описания, раздел из трёх строк: система читает такое и решает, что показывать нечего. Это не наказание, а отбор.
Пятая — краулинговый бюджет. Если робот тратит обход на тысячи мусорных адресов с параметрами, до нужных страниц он доходит редко. Лечится не текстом, а уборкой в адресах.
Чего делать не надо
Отправлять одну и ту же страницу на переобход по десять раз: очередь от этого не ускоряется, а суточная квота тратится. Массово закрывать «лишние» страницы в robots.txt, чтобы улучшить статистику: запрет обхода не убирает страницу из поиска, а наоборот лишает систему возможности прочитать ваш же noindex.
И не стоит гнаться за тем, чтобы в индексе было столько же страниц, сколько на сайте. Часть страниц там быть не должна — служебные, технические, фильтры. Здоровая картина — это когда в поиске все страницы, которые вы хотели туда отдать, а не все существующие.