Дубли ищут по-разному, и способы находят разное. Мы прогнали пять способов по одной и той же выборке сайтов и посчитали, кто что увидел.
Способ 1. Пять написаний одного адреса
Самый быстрый и совсем без инструментов. Одна и та же главная открывается по нескольким адресам: http:// и https://, с www и без, со слешем на конце и без него, /index.php и корень, адрес с рекламной меткой.
Откройте главную всеми написаниями подряд. Если каждое отдаёт страницу с кодом 200 и не переадресует к одному варианту — у сайта столько же копий главной. Разбор этого способа с замером — в отдельной статье: лишние адреса нашлись у 35 сайтов, но настоящий риск был у двенадцати, у остальных стояла подпись canonical.
Что пропускает: всё, кроме главной.
Способ 2. Оператор site: в поиске
Запрос site:example.ru показывает, что поиск взял с сайта. Пролистав выдачу, видно одинаковые заголовки и почти одинаковые описания рядом — это и есть кандидаты.
Что пропускает: число в ответе — оценка, а не счёт, и у крупных сайтов оно круглое. Дубли, которые поиск уже выбросил, в такой выдаче не покажутся вовсе — а именно они интереснее всего.
Способ 3. Одинаковые Title и H1
Способ, который советуют чаще прочих: выгрузить заголовки всех страниц и найти повторы. Он дёшев, понятен и не требует ничего, кроме списка адресов из карты сайта.
Что пропускает: почти всё. Ниже цифры.
Способ 4. Сравнение текста страниц
Страницы сравниваются между собой по содержанию. Мы считаем совпадение по пятёркам слов и убираем шапку, подвал, меню и боковые колонки — с ними любые две страницы одного сайта похожи примерно на треть, и сравнивать бессмысленно. Совпадение от 70% считаем дублем, от 45 до 70% — поводом посмотреть.
Что пропускает: страницы вне карты сайта и всё, что не читается без выполнения скриптов.
Замер: что нашёл каждый способ
21.09.2026 мы прогнали проверку по выборке из 69 сайтов Екатеринбурга — услуги, ремонт, небольшая розница. До сравнения дошло 52: у остальных не нашлась карта сайта или проверка не уложилась в свой бюджет. С каждого сайта брали до 25 страниц из карты, до потолка дошли 45 проверок.
| Что искали | На скольких сайтах нашлось |
|---|---|
| Совпадение текста от 70% | 44 |
| Совпадение текста 45–70% | 46 |
| Одинаковый H1 | 7 |
| Одинаковый Title | 6 |
| Чисто по всем признакам сразу | 5 |
Главное в этой таблице — не верхняя строка, а разрыв между ней и нижними. Поиск по одинаковым заголовкам нашёл бы дубли на шести сайтах из сорока четырёх, где они есть: 38 проверенных сайтов он пропустил бы молча. Обратных случаев — когда Title совпадают, а текст разный — не нашлось ни одного.
Объяснение простое и его видно в самих страницах. Мелкий сайт делает страницы услуг по одному шаблону: меняется название услуги в заголовке и пара строк в тексте, остальное общее. Заголовки при этом аккуратно разные — их пишут руками. А текста своего на странице столько, что различий не набирается и на треть.
Самая большая группа одинаковых Title в выборке — 14 адресов. Медианная проверка заняла 5,7 секунды.
Способ 5. Панель вебмастера
Четыре способа выше отвечают на вопрос «похожи ли страницы». Только панель вебмастера отвечает на вопрос, который на самом деле важен: что из этого поиск считает дублем. Раздел «Индексирование → Страницы в поиске → Исключённые» показывает статус «Дубль» с указанием адреса, который поиск выбрал главным.
Это единственный способ, требующий прав на сайт, — и единственный, чьё мнение решает. Остальные четыре только предполагают.
У нас самих, кстати, дубли оказались ни при чём: 42 страницы не вошли в поиск, причину искали в дублях, а нашли в возрасте страниц.
Что из этого выбрать
- Начните с пяти написаний главной — минута, и половина проблем видна сразу.
- Прогоните сравнение текста, а не заголовков. Наша проверка на дубли берёт до 25 страниц из карты сайта и сравнивает их между собой; результат — список пар с процентом совпадения.
- Сверьтесь с панелью вебмастера, если сайт ваш. Похожесть — гипотеза, статус «Дубль» — факт.
- Не чините то, что уже помечено canonical. Лишний адрес с подписью на главный — не дубль, а нормальная работа сайта.
Как это выглядит у нас
Та же проверка на nexforce.ru: 25 страниц из 270, пар с совпадением выше 45% — ноль, одинаковых Title и H1 — ноль, 2,5 секунды. Это не повод гордиться: 25 страниц из 270 — выборка, и ровный результат означает только, что в ней ничего не нашлось.
Границы замера
Сравнивали до 25 страниц с сайта, и 45 проверок в этот потолок упёрлись — значит, для большинства сайтов мы видели часть, а не всё. Порог в 70% выбран нами, а не поиском: где проходит граница у Яндекса, снаружи не известно.
Выборка — сайты малого бизнеса одного города. У них мало своего текста на странице, и высокая доля совпадений во многом отсюда. На сайте с длинными разными текстами картина будет другой.
Коротко
Способов пять: пять написаний главной, оператор site:, одинаковые Title и H1, сравнение текста и панель вебмастера. Самый популярный — по заголовкам — на нашей выборке пропустил 38 сайтов из 44, где дубли есть. Сравнение текста находит почти всё, но остаётся гипотезой: дублем страницу назначает поиск, и увидеть это можно только в панели вебмастера.
