Дубли страниц — самая недооценённая техническая проблема на сайтах с каталогом. Она не выглядит поломкой: страницы открываются, тексты на них разные, ошибок в панели вебмастера нет. А половина каталога при этом в поиск не попадает.
Проверка выше сравнивает страницы вашего сайта между собой и показывает пары с совпадающим текстом. Ниже — что за этим стоит: откуда дубли страниц берутся, какими бывают и чем каждый вид лечится.
Почему поиск дублей приходится вести отдельно
Поисковая система не сообщает «у вас дубли» — она молча выбирает из группы одинаковых страниц одну и перестаёт показывать остальные. В отчётах это выглядит как «страница обойдена, но не в поиске», и причина там не указана. Поэтому поиск дублей ведётся своими силами: сравнением страниц между собой, а не ожиданием сигнала снаружи.
Три вида дублей, и путают их постоянно
Технические — одна и та же страница доступна по разным адресам: со слешем и без, с www и без, по http и https, по /index.php и по корню, с приставленными метками рекламных кампаний. Содержимое буквально одно, адресов несколько.
Контентные — адреса разные и страницы формально самостоятельные, но текст на них совпадает. Классика: карточки товара, отличающиеся одним параметром, и описания категорий, размноженные по городам подстановкой названия.
Смысловые — тексты разные, а отвечают страницы на один и тот же вопрос. Их не найдёт ни одно сравнение по словам: видно только по тому, что обе страницы борются за один запрос и обе стоят низко.
Технические
Совпадает адресОдна и та же страница открывается по разным адресам: со слешем и без, с www и без, по http и https, с метками рекламных кампаний.
Постоянное перенаправление на выбранное написание. Одно правило на сервере — и вопрос закрыт навсегда.
находит наша проверкаКонтентные
Совпадает текстАдреса разные, страницы формально самостоятельные, но текст на них один: карточки, отличающиеся параметром, описания категорий, размноженные по городам.
Переписать, склеить или указать канонический адрес — смотря нужны ли обе страницы людям.
находит наша проверкаСмысловые
Совпадает намерениеТексты разные, а отвечают страницы на один и тот же вопрос. Видно только по тому, что обе борются за один запрос и обе стоят низко.
Объединить страницы или развести их по разным запросам.
снаружи не определяетсяНаша проверка закрывает второй вид и часть первого: сравнивает страницы из карты сайта между собой по совпадению текста без шапки, подвала и меню, и отдельно собирает группы с одинаковым Title и H1. Первый вид целиком проверяется вручную — достаточно открыть сайт по четырём написаниям адреса и посмотреть, все ли ведут на один.
Чем чинятся дубли страниц
Технические дубли — постоянным перенаправлением на выбранное написание адреса. Одно правило на сервере, и вопрос закрыт навсегда. Метки рекламных кампаний убираются директивой Clean-param в robots.txt для Яндекса и каноническим адресом для Google.
Контентные — либо переписыванием, либо каноническим адресом на основную версию, либо склейкой страниц в одну. Выбор зависит от того, нужны ли обе страницы людям: если да — переписываем, если это технический побочный продукт фильтра — закрываем каноническим адресом.
Отдельно про фильтры каталога. Страницы вида «красные кроссовки 42 размера» плодятся тысячами, и закрывать их все подряд неправильно: часть из них отвечает на реальный спрос и должна быть в поиске. Правило простое — открыт тот фильтр, под который есть запросы с частотой, остальные закрыты от индексации.
Чего проверка не покажет
Смысловые дубли, потому что для их поиска нужны позиции по запросам, а не тексты — их видно только в связке с полной проверкой — дубли страниц в бесплатном аудите смотрятся вместе с остальной технической частью. И дубли на страницах, закрытых от обхода в robots.txt: мы соблюдаем запрет, поэтому такие адреса не читаем вовсе. Если карта сайта неполная, сравнение пройдёт только по тому, что в ней перечислено — это стоит проверить до того, как радоваться чистому результату.