Sitemap — публичный файл, который сайт отдаёт роботам сам. Из него видно то, чего не покажет ни один сервис анализа: из чего сайт состоит на самом деле и на что владелец делает ставку.
Где искать
Сначала robots.txt. Откройте site.ru/robots.txt и найдите строку Sitemap: — там точный адрес. Надёжнее, чем угадывать: файл может лежать где угодно и называться как угодно.
Если строки нет — пробуйте site.ru/sitemap.xml. Соглашение, а не правило, но срабатывает в большинстве случаев.
Оба файла существуют затем, чтобы их читали. Никакого обхода защиты здесь нет.
Что вы увидите
Файлов бывает два вида, и различить их надо первым делом.
Список адресов — файл с тегами <loc>, внутри сами страницы.
Указатель — файл с тегами <sitemap>, внутри ссылки на другие такие же. У больших сайтов почти всегда так: отдельный файл под товары, под статьи, под категории.
Из трёх агентств, которые мы смотрели, у двух оказался указатель с восемью-девятью вложенными файлами, у третьего — плоский список на 1931 адрес.
Что из этого следует
Разложите адреса по первому разделу пути — и структура видна целиком. Живой пример, разбор одного из агентств:
| Раздел | Страниц |
|---|---|
| /blog/ | 1695 |
| /courses/ | 83 |
| /cost/ | 49 |
| /company/ | 31 |
| /articles/ | 29 |
| /instrumentyi-i-kalkulyator/ | 10 |
Читается однозначно: 88 процентов сайта — блог. Ставка сделана на информационный трафик, а не на посадочные под услуги. Коммерческих страниц меньше сотни на весь сайт.
Разбор занимает минуту и отвечает на вопрос, который обычно задают сервисам за деньги: чем конкурент вообще занят.
Как разобрать разом, а не глазами
Файл на две тысячи адресов глазами не читают. Достаточно вытащить адреса и посчитать их по разделам — это одна строка в терминале:
curl -s https://site.ru/sitemap.xml \
| grep -o '<loc>[^<]*' | sed 's|<loc>||' \
| awk -F/ '{print $4}' | sort | uniq -c | sort -rn
На выходе — та самая таблица разделов с числом страниц в каждом. Если попался указатель, сначала вытащите из него адреса вложенных файлов тем же способом и пройдите по ним.
Ограничения, о которых стоит помнить: файл бывает сжат в .gz, тогда его надо распаковать; бывает разбит на части по пятьдесят тысяч адресов; и бывает закрыт от посторонних, хотя это редкость — он существует ровно затем, чтобы его читали.
Даты изменения
Тег <lastmod> хранит дату последнего изменения страницы. У сайта из примера свежайшая совпала с днём проверки — файл живой и обновляется.
Полезнее, чем кажется. Одинаковый lastmod, меняющийся после каждой сборки, сообщает поисковику «изменилось всё» — такой сигнал перестают учитывать. Мы это чинили: 121 страница из 155 получала дату сборки вместо даты правки.
Чего карта не покажет
Трафик и позиции. Файл говорит, что у сайта есть, а не что работает. Число страниц не равно результату: у нас 42 страницы там были и не вошли в поиск ни одной.
Страницы вне списка. Туда попадает то, что владелец решил положить. Часть сайта может отсутствовать вовсе.
Качество. Тысяча статей в списке не означает тысячу хороших.
Как это применить
- Посмотрите структуру трёх-четырёх конкурентов из своей выдачи. Обычно сразу видно, чем они берут: объёмом статей, числом гео-страниц или проработкой услуг.
- Сравните с собой. Не по количеству — по соотношению. Если у всех коммерческих страниц втрое больше, чем у вас, это разговор про структуру, а не про тексты.
- Проверьте свой файл на ту же ошибку с датами и на мусор: страницы с переадресацией, закрытые от индексации, несуществующие.
Проверить свой файл можно нашей бесплатной проверкой — она смотрит доступность, формат, число адресов и выборочно сами страницы. Что ещё показывает панель Яндекса про индексацию — в разборе Вебмастера.
