Перейти к содержимому
К
Версия сайта
SEO

robots.txt и sitemap.xml: как управлять индексацией

У каждого сайта есть два маленьких текстовых файла, которые решают, что поисковик увидит, а что — нет. Владельцы бизнеса о них обычно не знают. Узнают в тот момент, когда сайт три месяца висит в интернете, а в Яндексе его нет.

Мы регулярно начинаем аудит именно с robots.txt и sitemap.xml — и примерно на каждом третьем сайте находим там проблемы. Хорошая новость: чинится это быстро. Плохая: до этого сайт мог месяцами терять трафик на ровном месте.

Что закрывать в robots.txt

Файл robots.txt лежит в корне сайта и говорит поисковым роботам, какие разделы обходить, а какие пропускать. Логика простая: в индексе должны быть страницы, которые приносят клиентов, — услуги, товары, статьи. Всё служебное индексировать незачем.

Что обычно стоит закрыть от робота:

  • Корзину, оформление заказа и личный кабинет — там нет полезного контента.
  • Результаты поиска по сайту: они генерируют бесконечное число мусорных страниц.
  • Страницы фильтров и сортировок в каталоге — иначе интернет-магазин на 200 товаров превращается для робота в 20 000 почти одинаковых URL, и он тратит время на дубли вместо карточек товаров.
  • Админку и технические разделы.

У поисковиков есть лимит на обход — робот не будет сканировать сайт бесконечно. Если он утонул в страницах фильтров, до новых товаров может просто не дойти.

Один символ, который убивает сайт целиком

Классическая история. Разработчики делают сайт на тестовом домене и закрывают его строчкой Disallow: / — чтобы недоделанная версия не попала в поиск. Это правильно. Потом сайт переезжает на боевой домен, а строчка остаётся.

К нам пришёл клиент — мебельное производство. Новый сайт запустили в декабре, к марту из поиска не пришло ни одного человека. Директор грешил на дизайн и уже собирался всё переделывать. Мы открыли robots.txt — там стоял тот самый Disallow: / с разработки. Весь сайт был закрыт от индексации четыре месяца. Убрали одну строчку, отправили страницы на переобход — через три недели пошёл первый поисковый трафик.

Проверьте свой сайт прямо сейчас: откройте адрес вида vash-sait.ru/robots.txt. Если видите Disallow: / без уточнений — у вас проблема.

Sitemap.xml — список приоритетов, а не гарантия

Карта сайта sitemap.xml — противоположность robots.txt: она не запрещает, а подсказывает. Это список всех страниц, которые вы хотите видеть в поиске, с датами обновления. Робот сверяется с ним и понимает, куда идти в первую очередь.

Тут есть распространённое заблуждение. Наличие страницы в sitemap не гарантирует, что она попадёт в индекс. Поисковик всё равно сам решает, достойна ли страница выдачи. Карта сайта лишь ускоряет знакомство робота с сайтом — особенно это заметно на больших каталогах и после публикации новых разделов.

Следите, чтобы карта обновлялась автоматически. Мы встречали sitemap, который сформировали при запуске сайта и забыли: за два года в каталоге появилось 300 новых товаров, а в карте их не было. Робот находил их медленно и неохотно.

Как проверить оба файла

В Яндекс Вебмастере есть раздел «Инструменты» → «Анализ robots.txt»: вставляете любой URL сайта и видите, открыт он для робота или закрыт и каким именно правилом. Там же, в разделе «Индексирование» → «Файлы Sitemap», можно добавить карту сайта и следить за ошибками в ней.

В Google Search Console аналогично: отчёт «Файлы Sitemap» покажет, сколько страниц из карты Google принял, а инструмент проверки URL — почему конкретная страница не в индексе. Пятнадцать минут раз в месяц на оба сервиса — и вы застрахованы от сюрпризов.

Если сомневаетесь, что с индексацией вашего сайта всё в порядке, — покажите его нам. В CasperLab проверка robots.txt и sitemap.xml входит в базовый SEO-аудит: найдём закрытые разделы, мусор в индексе и подскажем, что исправить.

Продвинуть сайт в CasperLab

Поможем подобрать решение под вашу задачу и рассчитаем стоимость без обязательств.

Продвинуть сайт
Поделиться:
Где должен лежать файл robots.txt?
Строго в корне сайта, по адресу vash-sait.ru/robots.txt. В подпапках поисковики его не ищут — файл по любому другому адресу просто не работает.
Закрыл страницу в robots.txt, а она всё равно в выдаче. Почему?
Robots.txt запрещает обход, но не всегда удаляет страницу из индекса — Google может показывать её по внешним ссылкам. Для надёжного удаления используйте метатег noindex или инструмент удаления URL в панелях вебмастера.
Нужен ли sitemap.xml маленькому сайту на 10 страниц?
Критичной необходимости нет — такой сайт робот обойдёт и сам. Но карта делается за пять минут и лишней не будет: с ней новые страницы попадают в индекс заметно быстрее.