Индексация сайта
Индексация сайта это попадание его страниц в базу поисковой системы, из которой потом собирается выдача. Пока адрес в этой базе не появился, показать его по запросу нельзя: поисковик отвечает по своей копии интернета и живой сайт в момент запроса не открывает.
В разговоре словом «индексация» называют обычно всё сразу: и приход робота, и появление страницы в поиске, и её позицию по запросу. Механизмов за этим стоит три, и отказать может любой из них по своей причине. Страницу можно обойти и не взять в базу. Можно взять в базу и не показать ни по одному запросу.
Тема техническая, поэтому проверяется по первоисточникам: документация Google Search Central, Справка Яндекса для вебмастеров, стандарт RFC 9309 на протокол исключения роботов. Числа и даты ниже сняты в сентябре 2026 года и взяты оттуда.

Обход, индексация и ранжирование
Google описывает работу поиска тремя стадиями: сканирование, индексирование, показ результатов. На первой роботы скачивают текст, картинки и видео с найденных страниц. На второй содержимое разбирается и складывается в индекс. На третьей по запросу человека из индекса подбирается ответ.
Между стадиями стоят фильтры, и документация об этом говорит прямо: «Indexing isn't guaranteed; not every page that Google processes will be indexed». Про третью стадию оговорка отдельная: Search Console может показывать страницу проиндексированной, а в выдаче её не окажется.
Разделять стадии стоит потому, что лечатся они по-разному:
- Обход (сканирование, краулинг) это визит робота на адрес и скачивание содержимого. Робот приходит по расписанию, которое поисковая система выбирает сама. Механика визита разобрана в статье как работает веб-краулер.
- Индексация это решение сохранить страницу в базе поиска. Обход для этого нужен, но одного его мало: обойти могут и не взять.
- Ранжирование это место среди уже проиндексированных документов по конкретному запросу. Здесь работает релевантность, качество содержимого и десятки других сигналов.
Диагноз «страница не в поиске» без разделения стадий бесполезен. Нулевой трафик даёт и запрет обхода в robots.txt, и метка noindex в коде, и полная неспособность страницы конкурировать по своему запросу. Действия во всех трёх случаях разные.
Как страница попадает в индекс
Как поисковик узнаёт об адресе
Основной источник это ссылки: робот идёт по ним с уже известных страниц, внутренних и чужих. Второй источник это карта сайта в формате Sitemap. Протокол sitemaps.org версии 0.9 ограничивает один файл 50 000 адресами и 50 МБ в несжатом виде, дальше файлы собирают в индексный.
У Яндекса источников больше. Робот может брать адреса со счётчика Яндекс Метрики, если в Вебмастере включён обход по счётчикам. Отдельно Яндекс поддерживает протокол IndexNow, которым сайт сам сообщает об изменениях, не дожидаясь очередного визита. По списку участников на indexnow.org протокол принимают Bing, Яндекс, Seznam, Naver, Yep и Amazon. Google в этом списке нет.
Что решает, брать ли страницу
Обойдённая страница проходит отбор, и поводов отсеять её несколько. Содержимое повторяет другую страницу сайта. Адрес закрыт меткой noindex. Сервер отдал ошибку или пустой ответ. Страница слишком бедна, чтобы отвечать хоть на какой-то запрос. Гарантий не даёт ни один поисковик, и обе документации формулируют это одинаково осторожно.
robots.txt и мета-тег robots: разные инструменты
Два инструмента похожи на вид, а задачи решают разные, и от подмены одного другим ломается ровно то, что чинили.
Запрет обхода в robots.txt
Файл robots.txt управляет обходом. Он лежит в корне домена и говорит роботу, куда ходить не нужно. Протокол описан в RFC 9309, опубликованном в сентябре 2022 года по категории Standards Track. Стандарт требует разбирать не менее 500 кибибайт файла и не держать закэшированную копию дольше 24 часов, если файл доступен.
Яндекс поддерживает директивы User-agent, Disallow, Allow, Sitemap и Clean-param, а размер файла ограничивает 500 КБ. Директиву Crawl-delay Яндекс перестал учитывать 22 февраля 2018 года: объявление вышло 15 февраля, а скорость обхода переехала в отдельный инструмент Вебмастера.
Ключевое свойство запрета в robots.txt: он закрывает обход и только его. Google пишет, что адрес закрытой страницы всё равно может появиться в результатах поиска, только сниппет будет без описания, потому что содержимое робот не читал. Справка Яндекса говорит то же самое: «Если главная страница запрещена в файле robots.txt, но на нее ведут ссылки с других сайтов, страница может попасть в результаты поиска».
Мета-тег robots и заголовок X-Robots-Tag
Второй инструмент управляет индексацией. Директива noindex ставится либо мета-тегом в разделе head, либо HTTP-заголовком X-Robots-Tag для файлов вроде PDF, где кода страницы нет. Оба способа поддерживают и Google, и Яндекс. Прочие метатеги на попадание в индекс не влияют.
Работает это ровно наоборот запрету обхода: робот обязан зайти на страницу, прочитать метку и после этого выкинуть адрес из базы. Google формулирует условие жёстко: «For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler».
Почему noindex внутри robots.txt не работает
2 июля 2019 года Google объявил, что убирает из своего разборщика robots.txt код для недокументированных директив, в том числе noindex, nofollow и crawl-delay. Отключение состоялось 1 сентября 2019 года. Официальная замена та же самая: noindex мета-тегом или заголовком, при разрешённом обходе.
Отсюда типичная ошибка на живых сайтах: раздел закрывают в robots.txt и одновременно ставят на его страницах noindex. Робот не приходит, метку не видит, адрес продолжает висеть в выдаче. Чтобы страница ушла из индекса, обход ей надо оставить.
Дубли и канонический адрес
Один документ часто доступен по нескольким адресам: с параметрами сортировки, с меткой рекламной кампании, с завершающим слэшем и без него. Поисковик сводит такие адреса в группу и выбирает из неё один, канонический, который и показывает в выдаче.
Указать предпочтение можно тремя способами разной силы. Редирект Google называет сильным сигналом. Атрибут rel="canonical" тоже сильный сигнал. Присутствие адреса в карте сайта считается слабым. Ни один из них не является приказом: если Google найдёт нестыковку, он выберет другой адрес и покажет это в отчёте статусом «Duplicate, Google chose different canonical than user».
У Яндекса для параметров в адресе есть своя директива robots.txt Clean-param: она говорит роботу, что метки в ссылке при индексировании учитывать не нужно.
Краулинговый бюджет
Краулинговый бюджет это сочетание того, сколько робот способен скачать с конкретного сервера, и того, сколько он хочет скачать. Google разбирает величину на две части: crawl capacity limit зависит от здоровья сайта и падает при медленных ответах, ошибках 5xx и коде 429; crawl demand зависит от размера сайта, частоты обновлений, качества и популярности страниц.
Границу применимости Google задаёт числами. Руководство адресовано сайтам от миллиона уникальных страниц с содержимым, которое меняется примерно раз в неделю, и сайтам от 10 000 уникальных страниц с ежедневными изменениями. Всем остальным документация советует эту тему не читать вовсе.
Практический вывод для обычного корпоративного сайта или интернет-магазина на несколько тысяч адресов: проблемы краулингового бюджета у него нет, и оптимизировать нечего. Значимой она становится там, где каталог сам плодит миллионы адресов фильтрами, календарями и параметрами сортировки. Косвенно на неё влияет скорость загрузки сайта: медленный сервер прямо снижает верхнюю планку обхода.
Переобход и проверка индекса
Переобход это повторный визит робота на уже известный адрес, переиндексация это обновление сохранённой копии по итогам визита. Оба поисковика дают инструмент ускорения и оба отказываются обещать сроки.
Проверка идёт инструментом URL Inspection в Search Console: он показывает, известен ли адрес, обойдён ли, попал ли в индекс, и позволяет отправить запрос на индексирование. Отчёт «Индексирование страниц» даёт причину по каждому непроиндексированному адресу, среди статусов «Discovered - currently not indexed», «Crawled - currently not indexed», «Duplicate without user-selected canonical», «Excluded by noindex tag», «Blocked by robots.txt».
Оператор site: для проверки годится плохо. Документация предупреждает, что он «doesn't necessarily return all the URLs that are indexed under the prefix specified in the query», и советует сверяться инструментом URL Inspection.
Яндекс
В Вебмастере есть инструмент «Переобход страниц»: адреса передаются роботу с приоритетом. Квота суточная и зависит от сайта, конкретных чисел справка не называет. Обход занимает до трёх суток, данные в поиске обновляются в течение двух недель. Формулировка про результат однозначная: «Статус не означает, что робот проиндексировал страницу».
Для регулярной работы Яндекс предлагает три других канала: файл Sitemap, обход по счётчику Метрики и протокол IndexNow. Про последний справка тоже оговаривается, что переданные страницы могут остаться непроиндексированными. Список проиндексированного и причины исключения показывает раздел «Страницы в поиске».
Почему страницы выпадают из индекса
- Ответ сервера перестал быть успешным: 404, 410, 500, длительные таймауты.
- Появился запрет: строка в robots.txt после переезда или релиза, забытый noindex с тестового стенда.
- Страница склеилась с другим адресом по canonical или редиректу, иногда не тем, который планировали.
- Содержимое повторяет соседние страницы сайта или чужой текст.
- Домен сменил адреса без редиректов, и старые страницы ушли, а новые ещё не набрали обхода.
- Санкции поисковика по качеству сайта, отдельный сюжет со своей диагностикой.
Первый шаг разбора одинаков во всех случаях: посмотреть код ответа сервера и содержимое страницы глазами робота, а не браузера. Регулярную проверку этих вещей закрывает технический аудит сайта.
Ограничения и спорные места
Сроков индексации не обещает никто. Ни Google, ни Яндекс не публикуют норматив вида «новая страница попадает в индекс за N дней». Яндекс называет три дня на обход по инструменту переобхода и две недели на обновление данных, но оговаривает, что индексация из этого не следует. Цифры про «сутки до индекса» в отраслевых статьях описывают наблюдения на отдельных сайтах и заявленным поведением системы не являются.
Краулинговый бюджет не показывается числом. В интерфейсах Search Console и Вебмастера есть статистика обхода, но самой величины бюджета там нет. Оценки строят косвенно, по логам сервера, и методики у разных команд свои. Спорят и о применимости: у Google порог отсечения задан в документации, и для сайта на тысячу страниц разговор про бюджет описывает проблему, которой нет.
Полного списка проиндексированного не даёт ни один инструмент. Оператор site: заведомо неполон по признанию самого Google. Отчёты в панелях вебмастера показывают данные с задержкой и по своей выборке. Проверить конкретный адрес можно точно, посчитать «сколько всего страниц в индексе» точно не получится.
Настройки Google и Яндекса не переносятся друг на друга. Расхождения касаются директив robots.txt (Clean-param есть только у Яндекса, Crawl-delay не учитывает ни тот ни другой, но по разным причинам и с разных дат), источников информации о страницах (счётчик Метрики и IndexNow у Яндекса, ни того ни другого у Google), инструментов и названий статусов. Правило, снятое из одной документации и применённое к другому поисковику, это фактическая ошибка.
Что здесь быстро устаревает. Первыми стареют интерфейсы и названия отчётов: панели вебмастера перестраивают чаще, чем меняются правила. Дальше идут квоты инструментов ускорения, они не зафиксированы документально ни у Google, ни у Яндекса. Медленнее всего меняются стандарты: RFC 9309 и протокол sitemaps.org лежат неподвижно годами. При следующей ревизии статьи проверять стоит именно в этом порядке.
См. также
Источники
- Google Search Central. In-depth guide to how Google Search works. https://developers.google.com/search/docs/fundamentals/how-search-works
- Google Search Central. A note on unsupported rules in robots.txt, 02.07.2019 (отключение поддержки noindex, nofollow и crawl-delay с 01.09.2019). https://developers.google.com/search/blog/2019/07/a-note-on-unsupported-rules-in-robotstxt
- Google Search Central. Introduction to robots.txt (адрес закрытой страницы может появиться в выдаче без описания). https://developers.google.com/search/docs/crawling-indexing/robots/intro
- Google Search Central. Block Search indexing with noindex. https://developers.google.com/search/docs/crawling-indexing/block-indexing
- Google Search Central. How to specify a canonical URL with rel="canonical" and other methods. https://developers.google.com/search/docs/crawling-indexing/consolidate-duplicate-urls
- Google Search Central. Large site owner's guide to managing your crawl budget (пороги 1 000 000 и 10 000 страниц, crawl capacity limit, crawl demand). https://developers.google.com/crawling/docs/crawl-budget
- Google Search Central. How to use the site: search operator. https://developers.google.com/search/docs/monitor-debug/search-operators/all-search-site
- Google Search Console Help. URL Inspection tool. https://support.google.com/webmasters/answer/9012289
- Google Search Console Help. Page indexing report (статусы непроиндексированных страниц). https://support.google.com/webmasters/answer/7440203
- IETF. RFC 9309, Robots Exclusion Protocol, M. Koster, G. Illyes, H. Zeller, L. Sassman, сентябрь 2022, Standards Track (лимит разбора 500 KiB, кэш не более 24 часов). https://www.rfc-editor.org/rfc/rfc9309.html
- sitemaps.org. Sitemaps XML format, протокол 0.9 (50 000 адресов и 50 МБ на файл). https://www.sitemaps.org/protocol.html
- Яндекс. Справка Вебмастера. Файл robots.txt (директивы, размер файла 500 КБ). https://yandex.ru/support/webmaster/ru/controlling-robot/robots-txt
- Яндекс. Справка Вебмастера. Как запретить индексирование сайта или страниц. https://yandex.ru/support/webmaster/ru/adding-site/indexing-prohibition
- Яндекс. Справка Вебмастера. Переобход страниц (до трёх суток на обход, две недели на обновление данных). https://yandex.ru/support/webmaster/ru/robot-workings/site-reindex
- Яндекс. Справка Вебмастера. Поддержка протокола IndexNow. https://yandex.ru/support/webmaster/ru/indexing-options/index-now
- Яндекс. Справка Вебмастера. Индексирование сайта с помощью счетчика Метрики. https://yandex.ru/support/webmaster/ru/indexing-options/link-metrica
- Блог Яндекса для вебмастеров. «Скорость обхода» или об изменениях в учёте директивы Crawl-delay, 15.02.2018 (отказ от учёта с 22.02.2018). https://webmaster.yandex.ru/blog/skorost-obkhoda-ili-ob-izmeneniyakh-v-uchete-direktivy-crawl-delay
- IndexNow. FAQ, список поисковых систем, поддерживающих протокол. https://www.indexnow.org/faq