Индексация

Файл robots.txt: что это и как составить без ошибок

Иллюстрация к статье «Файл robots.txt: что это и как составить без ошибок»
В избранное — зарегистрироватьсяНравится — зарегистрироваться

Файл robots.txt управляет обходом страниц роботами, но сам по себе не гарантирует ни удаления адреса из поиска, ни появления в нём. Если нужной страницы нет в Яндексе, проверьте правило для её URL, ответ сервера и статус в Вебмастере. Ниже — рабочий пример и порядок проверки.

Что такое robots.txt и что он на самом деле делает

Файл лежит по адресу https://example.ru/robots.txt и доступен всем. Робот запрашивает его перед обходом и читает правила: куда можно заходить, куда не нужно.

Важное ограничение: robots.txt управляет обходом, а не показом в поиске. Он говорит «не заходи», но не говорит «не показывай». Если на закрытую страницу ведут ссылки, ее адрес все равно может появиться в результатах поиска — без описания, потому что содержимое робот не читал.

Чтобы убрать страницу из поиска, нужен другой инструмент — директива noindex в коде страницы или в ответе сервера. И тогда страница должна быть открыта для обхода: закрытую в robots.txt страницу робот не откроет и noindex не увидит.

Правила необязательны к исполнению: добросовестные роботы Яндекса и Google их соблюдают, вредоносные — нет. Закрывать robots.txt личные данные бесполезно, для этого нужен пароль.

Основные директивы

Файл состоит из блоков. Каждый блок начинается с указания робота, к которому относятся правила.

  • User-agent: — для какого робота правила; * означает «для всех», Yandex — для роботов Яндекса, Googlebot — для Google
  • Disallow: — что не обходить; Disallow: /admin/ закрывает раздел, Disallow: / закрывает весь сайт
  • Allow: — исключение из запрета, разрешает отдельный адрес внутри закрытого раздела
  • Sitemap: — полный адрес карты сайта; указывается один раз и действует для всех роботов
  • Clean-param: — только для Яндекса: какие параметры в адресе не меняют содержимое страницы

Рабочий пример для сайта

Для большинства сайтов подходит короткий файл: закрыть служебные разделы, поиск по сайту и корзину, все остальное оставить открытым.

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/
Disallow: /*?sort=
Allow: /

Sitemap: https://example.ru/sitemap.xml

Что Яндекс и Google понимают по-разному

Google в 2019 году перестал учитывать директиву Host и перестал поддерживать Noindex внутри robots.txt. Яндекс Host тоже больше не использует: главное зеркало определяется переадресацией 301 и тегом canonical.

Директива Crawl-delay — пауза между запросами робота — Google не поддерживается, скорость обхода настраивается в Search Console. Яндекс ее тоже не учитывает: скорость задается в Вебмастере.

Clean-param: понимает только Яндекс. Для Google те же параметры убирают тегом canonical. Подробнее — в статье «Clean-param в Яндексе».

Устаревшие и нерабочие строки в файле — частая находка при проверке. В справочнике ошибок это «Директивы robots.txt, которые Яндекс не учитывает» (YA-02).

Пять ошибок, которые стоят трафика

Первая опасная ошибка — Disallow: / на рабочем сайте. Такое правило запрещает роботу обходить все страницы. Оно может помешать обновлять данные о них в поиске, но само по себе не доказывает, почему конкретный URL исключён: проверьте статус в Вебмастере.

Вторая — закрыть папки со стилями и скриптами. Без них робот видит сайт как сломанную страницу и не может оценить мобильную версию.

Третья — надеяться, что robots.txt уберет страницу из поиска. Закрытый адрес остается в результатах без описания; нужен noindex на открытой странице.

Четвертая — закрыть в robots.txt страницы, на которых стоит noindex или canonical. Робот их не откроет и указания не прочитает.

Пятая — файл отвечает ошибкой. Если robots.txt отвечает 5xx, Google сначала приостанавливает обход и повторно запрашивает файл. Яндекс тоже требует доступный файл с ответом 200. Не считайте ошибку файла постоянным запретом для обоих роботов. В справочнике это «Проблемы robots.txt» (IDX-02).

Пример: статья есть на сайте, но не в поиске

Учебный пример: статья https://example.ru/blog/robots-txt отвечает кодом 200, а в файле robots.txt есть Disallow: /blog/. В инструменте анализа robots.txt укажите полный URL статьи: запрет подтвердит проблему обхода. Уберите ошибочное правило, проверьте доступ повторно и дождитесь нового обхода.

Если запрета нет, не меняйте robots.txt наугад. Откройте «Исключённые страницы» в Вебмастере: при статусе «малоценная или маловостребованная» проверьте содержание и поисковый запрос, на который отвечает статья. Этот статус не равен запрету в robots.txt.

Как проверить результат

Сначала откройте https://example.ru/robots.txt в браузере: файл должен показываться как обычный текст и отвечать кодом 200. Как посмотреть код ответа — в статье «Коды ответа сервера».

Затем проверьте правила в официальных инструментах. В Яндекс Вебмастере это «Инструменты» → «Анализ robots.txt»: туда можно подставить конкретный адрес и увидеть, разрешен он или запрещен. В Google Search Console файл показывает отчет «robots.txt», а отдельный адрес — «Проверка URL».

Проверяйте не только главную, но и адреса важных разделов: карточку товара, страницу услуги, статью блога. Ошибка обычно закрывает не весь сайт, а один шаблон.

SEO title проверяет доступность страниц и правила для Яндекса и Google, включая проблемы robots.txt (IDX-02). Для причины исключения URL из поиска сопоставьте результат проверки со статусом в Вебмастере.

Первоисточники

FAQ

Частые вопросы

Удалит ли Disallow страницу из результатов поиска?

Не обязательно. Disallow ограничивает обход, но адрес может остаться известным поисковой системе. Для исключения из поиска нужен доступный роботу сигнал noindex или другой подходящий способ.

Где должен находиться robots.txt?

В корне соответствующего сайта: например, https://example.ru/robots.txt. Файл по другому пути не заменяет корневой robots.txt.

Как проверить правку robots.txt?

Откройте файл напрямую, проверьте нужные правила для робота Яндекса и Google и затем посмотрите, может ли каждый из них обойти важные URL.

Проверьте себя

Вопрос 1 из 2. Результат увидите только вы.

Что регулирует robots.txt?

Обсуждение

Какая строка в вашем robots.txt вызывает сомнения?

Войдите, чтобы оставить комментарий. Читать обсуждение могут все. Комментарии проходят автоматическую и редакционную проверку.