Каталог отличается от блога тем, что адреса в нём порождает не человек, а комбинаторика. Три фильтра по пять значений — это больше сотни сочетаний, и каждое живёт по собственному адресу с почти тем же содержимым.
Откуда берётся мусор
Четыре источника, и они складываются:
- Фильтры. Цвет, размер, цена, бренд — каждая комбинация даёт адрес.
- Сортировки. Один и тот же список товаров в четырёх порядках — четыре адреса.
- Пагинация. Страницы 2, 3, 4… с разными товарами, но одинаковыми заголовком и описанием.
- Метки рекламы.
utm_source,yclid,gclid— тот же адрес, но формально другой.
Первые два множатся друг на друга, а последний добавляется к любому из них. Отсюда каталоги, где на сотню товаров приходятся тысячи адресов, и все они — дубли.
Замер: 177 файлов robots.txt
7 сентября 2026 года мы прочитали robots.txt у сайтов компаний
Екатеринбурга — прочитались 177 из 264. Часть остальных молчала не по своей
вине: замер шёл с европейского адреса, а часть российских сайтов их не
пускает.
| Что считали | Значение |
|---|---|
Правил Disallow: медиана | 15 |
Правил Disallow: среднее | 45 |
Правил Disallow: максимум | 1157 |
| Закрывают пагинацию | 70 |
| Закрывают фильтры и сортировку | 25 |
| Закрывают рекламные метки | 41 |
Используют Clean-param | 53 |
| Без единого правила | 20 |
Медиана 15 и среднее 45 расходятся втрое — значит, дело не в «обычных» сайтах, а в нескольких каталогах, которые тянут среднее вверх.
Два подхода на живых каталогах
Две мебельные площадки решают одну задачу противоположными способами.
Первая — запретами. 416 строк, 398 правил Disallow и три
Clean-param. Закрыто всё: /*filter*, /*pagen, /*PAGEN, метки, сортировки,
поиск.
Вторая — склейкой. 333 строки, 161 Disallow и 156 директив
Clean-param. Параметры не запрещены к обходу, но объявлены незначащими:
робот Яндекса читает страницу и отбрасывает параметр.
Разница принципиальная. Запрет в robots.txt — это отказ обходить: робот не
зайдёт на адрес и не увидит ссылок, которые на нём стоят. Закрыв пагинацию, вы
закрываете и путь к товарам с дальних страниц. Clean-param работает
иначе: страница обходится, а параметр не создаёт нового
адреса. Минус в том, что директиву понимает только Яндекс.
Рекордсмен: 1157 правил, из них 380 — повторы
Самый большой файл в выборке — у крупной мебельной сети: 1348 строк и 1157
правил Disallow. Разобрали его по секциям:
| Что внутри | Значение |
|---|---|
| Уникальных правил | 395 |
| Повторяющихся | 380 |
Секций User-agent | 12 |
Правила продублированы для Яндекса, Google и всех остальных — отсюда и трёхкратный объём. Из 1157 правил только девять относятся к фильтрам и 23 к пагинации; 597 закрывают адреса с параметрами, 528 — просто разделы.
Отдельная деталь: восемь секций файла закрывают целиком не поисковых роботов, а агентов ИИ-сервисов — от GPTBot до Claude-SearchBot. К мусорным адресам это отношения не имеет, но показывает, что файл ведут осознанно.
Сколько секций в файле и зачем они
Ещё одно место, где файлы разрастаются без пользы, — секции User-agent.
Медиана по корпусу — одна секция, но у одиннадцати площадок их пять и больше:
| Площадка | Секций | Правил |
|---|---|---|
| Мебельный магазин | 44 | 75 |
| Поставщик мебели | 14 | 34 |
| Мебельный магазин | 13 | 48 |
| Крупная сеть | 12 | 1157 |
Сорок четыре секции — это перечисление роботов поимённо, каждому свой набор правил. Иногда так и надо: закрыть сборщиков ссылок и агентов ИИ, оставив поисковых. Но чаще правила в секциях совпадают, и файл просто умножается на число агентов, а вместе с ним умножается шанс, что в одной из копий забудут поправить строку.
Практическое правило: разные секции нужны только там, где правила
действительно разные. Если у Яндекса и Google одинаковый набор — это одна
секция *.
Что делать с каждым исходом
| Что нашли у себя | Что делать |
|---|---|
Пагинация в Disallow | проверить, доходит ли робот до товаров другим путём; если нет — открыть |
Фильтры в Disallow | оставить, но убедиться, что базовый раздел без параметров открыт |
Рекламные метки в Disallow | заменить на Clean-param: адрес обойдётся, а параметр не создаст дубля |
| Правила продублированы в нескольких секциях | свести к *, если наборы совпадают |
| Файла нет или он отдаётся как HTML | сделать текстовый файл: без него правил у сайта нет |
| Карта сайта не указана | добавить Sitemap: — это одна строка |
Про последнюю строку: карта указана у 149 файлов из 174, то есть 25 площадок оставили робота искать её самому. Это не запрет и не ошибка, но одна строка здесь стоит дешевле, чем надежда на догадливость робота.
Чем закрывать: три инструмента и их цена
| Инструмент | Что делает | Цена |
|---|---|---|
Disallow в robots.txt | запрещает обход | адрес может остаться в выдаче без описания; ссылки на закрытой странице не обходятся |
rel=canonical | указывает основной адрес | не запрещает обход и не гарантирует склейку |
Clean-param | отбрасывает параметр | понимает только Яндекс |
Практическое правило: метки рекламы — Clean-param и canonical, фильтры —
canonical на основной раздел, пагинация — открыта. Закрывать пагинацию стоит
только тогда, когда вы уверены, что товары доступны роботу другим путём.
Как у нас
46 строк, четыре правила Disallow и одна директива Clean-param на метки
рекламы. Причина скучная: у нас нет каталога с фильтрами, а значит нет и
комбинаторики. Это не образец для магазина — это пример того, что размер файла
определяется устройством сайта, а не старательностью.
Посмотреть, какие адреса вашего каталога поисковик видит как одинаковые, можно проверкой дублей, а разбор каждой директивы — в статье про robots.txt.
Коротко
Мусорные адреса в каталоге рождает комбинаторика фильтров, сортировок и меток.
По 177 живым файлам robots.txt: медиана 15 правил, максимум 1157, пагинацию
закрывают 70 площадок, Clean-param используют 53. Инструментов три, и они
делают разное: запрет обхода, указание основного адреса и отбрасывание
параметра. Выбор между ними — это выбор цены, а не вкуса.
