Готовые robots.txt из шаблонов закрывают разделы чужих движков и не закрывают ваши. Поэтому вместо примера покажем свой файл целиком и объясним каждую строку — включая две, где мы нашли у себя противоречие.
Файл целиком
User-agent: *
Allow: /
Disallow: /agencyadmin/
Disallow: /admin/
Disallow: /dashboard/
Disallow: /api/
Disallow: /search/
Disallow: /sitemap-page/
Disallow: /blog/tag/
Disallow: /en/
Clean-param: utm_source&utm_medium&utm_campaign&utm_term&utm_content&yclid&gclid&from&_openstat&ysclid
Sitemap: https://nexforce.ru/sitemap.xml
12 значащих строк: 2 разрешающие, 8 запретов, 1 директива для Яндекса и 1 адрес карты. Дальше по порядку.
User-agent и Allow
User-agent: * — правила ниже относятся ко всем роботам. Allow: / —
разрешено всё, кроме перечисленного дальше.
Строка Allow: / не обязательна: без запрета всё и так разрешено. Мы держим
её как явное утверждение — чтобы файл читался как «открыто всё, кроме этого
списка», а не как набор запретов неизвестно к чему.
Восемь запретов и зачем каждый
/agencyadmin/,/admin/,/dashboard/— служебные разделы. Смысла в поиске нет, а лишний обход есть./api/— программные ответы, не страницы. Робот там ничего не найдёт, кроме нагрузки на сервер./search/— результаты поиска по сайту. Классический источник бесконечных адресов: сколько запросов, столько страниц./sitemap-page/— карта сайта для людей. Дублирует содержание списков и не нужна в выдаче./blog/tag/— страницы тегов. Каждая — подборка чужих анонсов без собственного содержания./en/— английский раздел, которого больше нет.
Обратите внимание: запрет в robots.txt — это запрет обхода, а не индексации. Страница, закрытая здесь, может попасть в выдачу без описания, если на неё ссылаются снаружи.
Два противоречия, которые нашлись у нас
Проверили свои же запреты 5 сентября 2026 года и нашли две ошибки.
Первая: запрет плюс noindex. 3 адреса — /search/, /sitemap-page/ и
страницы тегов — отдают noindex, follow и одновременно закрыты в robots.txt.
Проверено запросом: все три отвечают кодом 200 и несут запрет индексации в
разметке.
Это взаимоисключающие указания. Документация Google:
For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler. If the page is blocked by a robots.txt file or the crawler can't access the page, the crawler will never see thenoindexrule, and the page can still appear in search results, for example if other pages link to it.
То есть запрет обхода мешает сработать запрету индексации. Правильно —
оставить что-то одно: либо noindex и открытый обход, либо Disallow без
noindex.
Вторая: запрет поверх переадресации. Адрес /en/ отвечает кодом 301 и
ведёт на главную — и он же закрыт в robots.txt. Раздел удалён 30 августа
2026 года, переадресация стоит с тех пор. Робот, которому запрещён
обход, переадресацию не увидит, а значит старые адреса будут висеть в индексе
дольше, чем нужно.
Обе находки — наши собственные, и обе исправляются одной строкой. Мы их завели в работу, а не убрали из статьи: файл, который мы показываем как пример, честнее показать с ошибками.
Clean-param: строка для Яндекса
Метки рекламы не меняют содержимое страницы, но создают новый адрес. Директива
Clean-param говорит роботу Яндекса, какие параметры игнорировать.
Документация Яндекса объясняет смысл так:
Робот Яндекса, используя эту директиву, не будет многократно перезагружать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.
У нас перечислены 10 меток: 5 из семейства utm_*, 3 идентификатора переходов
(yclid, gclid, ysclid), а также from и _openstat. Для Google та же
задача решается иначе — тегом canonical без параметров; про canonical у нас
есть отдельный разбор.
Важно: метку нельзя закрывать переадресацией — ссылка с меткой обязана открываться. Об этом и других источниках дублей — в разборе восьми источников.
Sitemap
Последняя строка — адрес карты сайта. Она стоит вне секций User-agent и
относится ко всем роботам сразу. Это самый простой способ сообщить поисковику,
где лежит список ваших страниц, не заходя в панели вебмастера.
Что проверить в своём файле
- Каждая строка отвечает на вопрос «что именно я закрываю». Если ответа нет — строка из чужого шаблона.
- Нет ли запрета поверх noindex. Одно отменяет другое.
- Нет ли запрета поверх переадресации. Робот не увидит редирект.
- Указана ли карта сайта и открывается ли она по этому адресу.
Проверить свой файл можно нашей проверкой robots.txt: она читает файл, разбирает директивы и показывает, что именно закрыто.
