Robots.txt

Материал из Самая полная в Рунете энциклопедия интернет-маркетинга
Перейти к навигации Перейти к поиску

Robots.txt это текстовый файл в корне сайта, которым владелец говорит поисковым роботам, какие адреса обходить можно, а какие не надо. Робот запрашивает его раньше самих страниц и держит ответ в кэше: Google обновляет копию примерно раз в сутки.

Правила файла описаны стандартом Robots Exclusion Protocol. Мартейн Костер предложил его в 1994 году, а документом IETF он стал только в сентябре 2022 года, под номером RFC 9309.

Директивы

Адрес у файла один и жёсткий: example.ru/robots.txt, в корне хоста, иначе краулер его не найдёт. Внутри блоки. Каждый открывается строкой User-agent с именем робота (Yandex, Googlebot) или со звёздочкой для всех сразу. Дальше Disallow с путями, закрытыми от обхода, и Allow с исключениями внутри закрытого раздела. У Яндекса при равной длине префикса выигрывает Allow. Строка Sitemap с полным адресом карты сайта читается всеми роботами, к какому бы блоку она ни примыкала.

Две директивы живут не везде. Clean-param понимает только Яндекс: в ней перечисляют параметры адреса, не меняющие содержимое страницы (рекламные метки, идентификаторы сессий), и робот сводит такие адреса к одному. У Google аналога нет. Crawl-delay задавала паузу между запросами, и от неё отказались обе системы: Яндекс перестал её учитывать 22 февраля 2018 года и перенёс настройку в раздел «Скорость обхода» Вебмастера, Google объявил о прекращении поддержки 2 июля 2019 года. Google разбирает четыре поля (user-agent, allow, disallow, sitemap) и читает первые 500 КиБ файла.

Обход и показ это разные вещи

Здесь ошибаются чаще всего. Файл управляет обходом, а не присутствием в выдаче. Закрытый адрес робот не скачивает, но узнать о нём может по ссылкам с чужих сайтов, и тогда адрес всё равно попадёт в результаты поиска. Документация Google говорит прямо: robots.txt не механизм, скрывающий страницу из поиска. Выглядит такая находка бедно, голым адресом без нормального сниппета, потому что описание брать неоткуда.

Убирает страницу из выдачи мета-тег robots со значением noindex (см. Метатеги) либо пароль на доступ. Ловушка в том, что мета-тег робот обязан прочитать, а для этого скачать страницу. Закрыв её ещё и в robots.txt, вы запрещаете обход, и noindex остаётся невидимым. Внутри самого robots.txt строка noindex тоже не работает: Google выключил её поддержку 1 сентября 2019 года.

Ошибки и риски

  • Файл приехал с тестового сервера. На разработке сайт закрывают строкой Disallow: /, при переносе про неё забывают, и сайт вылетает из индекса целиком.
  • Закрытые css и js. Робот собирает страницу как браузер. Не получив стили и скрипты, он видит её иначе, чем посетитель, и судит о ней по обломкам.
  • Файл как защита приватного. Robots.txt открыт любому по прямой ссылке, и список закрытых каталогов работает подсказкой, куда заглянуть. Личные данные закрывают авторизацией.

Правила для практика

  • Открывать example.ru/robots.txt в браузере после каждого переноса и релиза: правка приезжает незаметно.
  • Проверять правила валидатором в панели вебмастера, а не глазами; такие анализаторы входят в базовый набор при аудите сайта.
  • Разделять задачи: обход закрывается через Disallow, показ в выдаче через noindex, приватность через пароль. Одно другим не заменяется.
  • Держать файл коротким и понятным без комментариев к нему. Длинные списки исключений обычно означают проблему в структуре сайта, и её лечат обычной оптимизацией.

Источники

  1. IETF. RFC 9309 «Robots Exclusion Protocol». Standards Track, сентябрь 2022. Авторы M. Koster, G. Illyes, H. Zeller, L. Sassman. https://www.rfc-editor.org/info/rfc9309/
  2. Google Search Central. «Introduction to robots.txt». Сверено 06.09.2026. https://developers.google.com/search/docs/crawling-indexing/robots/intro
  3. Google Search Central. «Robots.txt Specifications»: поддерживаемые поля, лимит 500 КиБ, кэш до 24 часов. Сверено 06.09.2026. https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec
  4. Google Search Central Blog. «A note on unsupported rules in robots.txt». 02.07.2019. https://developers.google.com/search/blog/2019/07/a-note-on-unsupported-rules-in-robotstxt
  5. Яндекс. Справка для вебмастеров. «Директивы Disallow и Allow». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/allow-disallow
  6. Яндекс. Справка для вебмастеров. «Директива Clean-param». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/clean-param.html
  7. Яндекс. Справка для вебмастеров. «Директива Crawl-delay». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/crawl-delay.html