Перейти к содержимому
SEO/Опубликовано 7 сентября 2026 г./5 мин

Пагинация и фильтры: где каталог плодит мусорные адреса

Прочитали robots.txt 177 сайтов Екатеринбурга. Медиана — 15 правил, максимум 1157, и у одного каталога 380 из них повторяются. Разбираем, откуда берутся лишние адреса и чем их закрывать.

Пагинация и фильтры: где каталог плодит мусорные адреса
С
Команда NEXFORCE
SEO-эксперт NEXFORCE

Каталог отличается от блога тем, что адреса в нём порождает не человек, а комбинаторика. Три фильтра по пять значений — это больше сотни сочетаний, и каждое живёт по собственному адресу с почти тем же содержимым.

Откуда берётся мусор

Четыре источника, и они складываются:

  • Фильтры. Цвет, размер, цена, бренд — каждая комбинация даёт адрес.
  • Сортировки. Один и тот же список товаров в четырёх порядках — четыре адреса.
  • Пагинация. Страницы 2, 3, 4… с разными товарами, но одинаковыми заголовком и описанием.
  • Метки рекламы. utm_source, yclid, gclid — тот же адрес, но формально другой.

Первые два множатся друг на друга, а последний добавляется к любому из них. Отсюда каталоги, где на сотню товаров приходятся тысячи адресов, и все они — дубли.

Замер: 177 файлов robots.txt

7 сентября 2026 года мы прочитали robots.txt у сайтов компаний Екатеринбурга — прочитались 177 из 264. Часть остальных молчала не по своей вине: замер шёл с европейского адреса, а часть российских сайтов их не пускает.

Что считалиЗначение
Правил Disallow: медиана15
Правил Disallow: среднее45
Правил Disallow: максимум1157
Закрывают пагинацию70
Закрывают фильтры и сортировку25
Закрывают рекламные метки41
Используют Clean-param53
Без единого правила20

Медиана 15 и среднее 45 расходятся втрое — значит, дело не в «обычных» сайтах, а в нескольких каталогах, которые тянут среднее вверх.

Два подхода на живых каталогах

Две мебельные площадки решают одну задачу противоположными способами.

Первая — запретами. 416 строк, 398 правил Disallow и три Clean-param. Закрыто всё: /*filter*, /*pagen, /*PAGEN, метки, сортировки, поиск.

Вторая — склейкой. 333 строки, 161 Disallow и 156 директив Clean-param. Параметры не запрещены к обходу, но объявлены незначащими: робот Яндекса читает страницу и отбрасывает параметр.

Разница принципиальная. Запрет в robots.txt — это отказ обходить: робот не зайдёт на адрес и не увидит ссылок, которые на нём стоят. Закрыв пагинацию, вы закрываете и путь к товарам с дальних страниц. Clean-param работает иначе: страница обходится, а параметр не создаёт нового адреса. Минус в том, что директиву понимает только Яндекс.

Рекордсмен: 1157 правил, из них 380 — повторы

Самый большой файл в выборке — у крупной мебельной сети: 1348 строк и 1157 правил Disallow. Разобрали его по секциям:

Что внутриЗначение
Уникальных правил395
Повторяющихся380
Секций User-agent12

Правила продублированы для Яндекса, Google и всех остальных — отсюда и трёхкратный объём. Из 1157 правил только девять относятся к фильтрам и 23 к пагинации; 597 закрывают адреса с параметрами, 528 — просто разделы.

Отдельная деталь: восемь секций файла закрывают целиком не поисковых роботов, а агентов ИИ-сервисов — от GPTBot до Claude-SearchBot. К мусорным адресам это отношения не имеет, но показывает, что файл ведут осознанно.

Сколько секций в файле и зачем они

Ещё одно место, где файлы разрастаются без пользы, — секции User-agent. Медиана по корпусу — одна секция, но у одиннадцати площадок их пять и больше:

ПлощадкаСекцийПравил
Мебельный магазин4475
Поставщик мебели1434
Мебельный магазин1348
Крупная сеть121157

Сорок четыре секции — это перечисление роботов поимённо, каждому свой набор правил. Иногда так и надо: закрыть сборщиков ссылок и агентов ИИ, оставив поисковых. Но чаще правила в секциях совпадают, и файл просто умножается на число агентов, а вместе с ним умножается шанс, что в одной из копий забудут поправить строку.

Практическое правило: разные секции нужны только там, где правила действительно разные. Если у Яндекса и Google одинаковый набор — это одна секция *.

Что делать с каждым исходом

Что нашли у себяЧто делать
Пагинация в Disallowпроверить, доходит ли робот до товаров другим путём; если нет — открыть
Фильтры в Disallowоставить, но убедиться, что базовый раздел без параметров открыт
Рекламные метки в Disallowзаменить на Clean-param: адрес обойдётся, а параметр не создаст дубля
Правила продублированы в нескольких секцияхсвести к *, если наборы совпадают
Файла нет или он отдаётся как HTMLсделать текстовый файл: без него правил у сайта нет
Карта сайта не указанадобавить Sitemap: — это одна строка

Про последнюю строку: карта указана у 149 файлов из 174, то есть 25 площадок оставили робота искать её самому. Это не запрет и не ошибка, но одна строка здесь стоит дешевле, чем надежда на догадливость робота.

Чем закрывать: три инструмента и их цена

ИнструментЧто делаетЦена
Disallow в robots.txtзапрещает обходадрес может остаться в выдаче без описания; ссылки на закрытой странице не обходятся
rel=canonicalуказывает основной адресне запрещает обход и не гарантирует склейку
Clean-paramотбрасывает параметрпонимает только Яндекс

Практическое правило: метки рекламы — Clean-param и canonical, фильтры — canonical на основной раздел, пагинация — открыта. Закрывать пагинацию стоит только тогда, когда вы уверены, что товары доступны роботу другим путём.

Как у нас

46 строк, четыре правила Disallow и одна директива Clean-param на метки рекламы. Причина скучная: у нас нет каталога с фильтрами, а значит нет и комбинаторики. Это не образец для магазина — это пример того, что размер файла определяется устройством сайта, а не старательностью.

Посмотреть, какие адреса вашего каталога поисковик видит как одинаковые, можно проверкой дублей, а разбор каждой директивы — в статье про robots.txt.

Коротко

Мусорные адреса в каталоге рождает комбинаторика фильтров, сортировок и меток. По 177 живым файлам robots.txt: медиана 15 правил, максимум 1157, пагинацию закрывают 70 площадок, Clean-param используют 53. Инструментов три, и они делают разное: запрет обхода, указание основного адреса и отбрасывание параметра. Выбор между ними — это выбор цены, а не вкуса.

Вопросы и ответы

FAQ по теме

Откуда в каталоге берутся лишние адреса?+
Из комбинаций. Три фильтра по пять значений дают больше сотни сочетаний, и каждое — отдельный адрес с почти тем же содержимым. Добавьте сортировку, пагинацию и рекламные метки, и один раздел превращается в тысячи адресов.
Чем закрывать параметры — robots.txt или canonical?+
Это разные инструменты. robots.txt запрещает обход, и закрытый адрес может остаться в выдаче без описания. Canonical не запрещает ничего, но говорит, какой адрес считать основным. Clean-param — директива Яндекса: адрес обходится, а параметр отбрасывается.
Сколько правил должно быть в robots.txt?+
Столько, сколько нужно вашему сайту. По нашему замеру 177 файлов медиана — 15 правил Disallow, среднее 45, максимум 1157. Большое число само по себе не ошибка, но у рекордсмена 380 правил из 1157 просто повторяются в разных секциях.
Нужно ли закрывать пагинацию?+
Не обязательно, и это решение с ценой. Закрытая в robots.txt пагинация мешает роботу дойти до товаров с дальних страниц: он не обходит адрес и не видит ссылок на нём. Из 177 проверенных файлов пагинацию закрывают 70.