Robots.txt
Robots.txt это текстовый файл в корне сайта, которым владелец говорит поисковым роботам, какие адреса обходить можно, а какие не надо. Робот запрашивает его раньше самих страниц и держит ответ в кэше: Google обновляет копию примерно раз в сутки.
Правила файла описаны стандартом Robots Exclusion Protocol. Мартейн Костер предложил его в 1994 году, а документом IETF он стал только в сентябре 2022 года, под номером RFC 9309.
Директивы
Адрес у файла один и жёсткий: example.ru/robots.txt, в корне хоста, иначе краулер его не найдёт. Внутри блоки. Каждый открывается строкой User-agent с именем робота (Yandex, Googlebot) или со звёздочкой для всех сразу. Дальше Disallow с путями, закрытыми от обхода, и Allow с исключениями внутри закрытого раздела. У Яндекса при равной длине префикса выигрывает Allow. Строка Sitemap с полным адресом карты сайта читается всеми роботами, к какому бы блоку она ни примыкала.
Две директивы живут не везде. Clean-param понимает только Яндекс: в ней перечисляют параметры адреса, не меняющие содержимое страницы (рекламные метки, идентификаторы сессий), и робот сводит такие адреса к одному. У Google аналога нет. Crawl-delay задавала паузу между запросами, и от неё отказались обе системы: Яндекс перестал её учитывать 22 февраля 2018 года и перенёс настройку в раздел «Скорость обхода» Вебмастера, Google объявил о прекращении поддержки 2 июля 2019 года. Google разбирает четыре поля (user-agent, allow, disallow, sitemap) и читает первые 500 КиБ файла.
Обход и показ это разные вещи
Здесь ошибаются чаще всего. Файл управляет обходом, а не присутствием в выдаче. Закрытый адрес робот не скачивает, но узнать о нём может по ссылкам с чужих сайтов, и тогда адрес всё равно попадёт в результаты поиска. Документация Google говорит прямо: robots.txt не механизм, скрывающий страницу из поиска. Выглядит такая находка бедно, голым адресом без нормального сниппета, потому что описание брать неоткуда.
Убирает страницу из выдачи мета-тег robots со значением noindex (см. Метатеги) либо пароль на доступ. Ловушка в том, что мета-тег робот обязан прочитать, а для этого скачать страницу. Закрыв её ещё и в robots.txt, вы запрещаете обход, и noindex остаётся невидимым. Внутри самого robots.txt строка noindex тоже не работает: Google выключил её поддержку 1 сентября 2019 года.
Ошибки и риски
- Файл приехал с тестового сервера. На разработке сайт закрывают строкой
Disallow: /, при переносе про неё забывают, и сайт вылетает из индекса целиком. - Закрытые css и js. Робот собирает страницу как браузер. Не получив стили и скрипты, он видит её иначе, чем посетитель, и судит о ней по обломкам.
- Файл как защита приватного. Robots.txt открыт любому по прямой ссылке, и список закрытых каталогов работает подсказкой, куда заглянуть. Личные данные закрывают авторизацией.
Правила для практика
- Открывать
example.ru/robots.txtв браузере после каждого переноса и релиза: правка приезжает незаметно. - Проверять правила валидатором в панели вебмастера, а не глазами; такие анализаторы входят в базовый набор при аудите сайта.
- Разделять задачи: обход закрывается через
Disallow, показ в выдаче черезnoindex, приватность через пароль. Одно другим не заменяется. - Держать файл коротким и понятным без комментариев к нему. Длинные списки исключений обычно означают проблему в структуре сайта, и её лечат обычной оптимизацией.
Источники
- IETF. RFC 9309 «Robots Exclusion Protocol». Standards Track, сентябрь 2022. Авторы M. Koster, G. Illyes, H. Zeller, L. Sassman. https://www.rfc-editor.org/info/rfc9309/
- Google Search Central. «Introduction to robots.txt». Сверено 06.09.2026. https://developers.google.com/search/docs/crawling-indexing/robots/intro
- Google Search Central. «Robots.txt Specifications»: поддерживаемые поля, лимит 500 КиБ, кэш до 24 часов. Сверено 06.09.2026. https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec
- Google Search Central Blog. «A note on unsupported rules in robots.txt». 02.07.2019. https://developers.google.com/search/blog/2019/07/a-note-on-unsupported-rules-in-robotstxt
- Яндекс. Справка для вебмастеров. «Директивы Disallow и Allow». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/allow-disallow
- Яндекс. Справка для вебмастеров. «Директива Clean-param». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/clean-param.html
- Яндекс. Справка для вебмастеров. «Директива Crawl-delay». Сверено 06.09.2026. https://yandex.ru/support/webmaster/ru/robot-workings/crawl-delay.html