Индексация
Сайт не индексируется: 9 причин и как проверить

Если сайт не индексируется, его страниц нет в базе поисковой системы — и по любому запросу их не покажут. Причин ровно девять, и восемь из них видно в Яндекс Вебмастере и Google Search Console за десять минут. Разбираем каждую: что происходит, как проверить самому и что покажет проверка сайта.
Что значит «сайт не индексируется»
Индексация — это добавление страницы в базу поисковой системы. Сначала робот обходит страницу (краулинг), затем решает, брать ли ее в базу (индексирование), и только после этого страница может появиться в результатах поиска.
Отсюда три разных состояния, которые часто путают. Робот не заходил на страницу — проблема с обходом. Робот зашел, но страницу не взял — проблема с индексированием. Страница в базе, но ее не показывают по запросам — это уже вопрос ранжирования, а не индексации.
Первый шаг — понять, какое из трех состояний у вас. В Яндекс Вебмастере это раздел «Индексирование → Страницы в поиске», в Google Search Console — отчет «Индексирование страниц». Оба показывают причину по каждому адресу.
Молодому сайту нужно время: первые страницы обычно появляются за срок от нескольких дней до 2–3 недель. Если сайту меньше недели и в Вебмастере нет ошибок, ждите.
Причины 1–2: запреты в robots.txt и метатеге noindex
Запрет в robots.txt. Самая частая причина: в файле https://example.ru/robots.txt осталась строка Disallow: / — так закрывают сайт на время разработки и забывают открыть после запуска.
Робот читает этот файл перед обходом и просто не заходит на закрытые адреса. В Вебмастере такие страницы получают статус «Запрещен в robots.txt», в Search Console — «Заблокировано в файле robots.txt».
Проверить просто: откройте адрес файла в браузере и найдите строки Disallow. Убедитесь, что закрыты только служебные разделы — корзина, поиск по сайту, личный кабинет.
Метатег noindex или заголовок X-Robots-Tag. Второй по частоте запрет живет в коде страницы: <meta name="robots" content="noindex">. Робот страницу открывает, читает запрет и не берет ее в базу. В отчетах это выглядит как «Исключена по тегу noindex».
Тот же запрет может приходить в HTTP-заголовке X-Robots-Tag: noindex — его в коде страницы не видно, он отдается сервером. Так часто настраивают тестовые площадки, а потом копируют конфигурацию на боевой сайт.
Отдельная ловушка у популярных CMS: в WordPress есть галочка «Попросить поисковые системы не индексировать сайт», в 1С-Битрикс и Tilda — похожие настройки в разделе публикации. Галочка ставит noindex на весь сайт.
# посмотреть заголовки ответа
curl -sI https://example.ru/ | grep -i x-robots-tagПричины 3–4: сервер отвечает плохо или робот не знает о страницах
Сервер отвечает ошибкой или слишком медленно. Если на запрос робота сервер отвечает кодом 5xx, страница в базу не попадет: для поисковика ее содержимого не существует. Коды 4xx означают, что страницы нет, — такие адреса тоже исключаются.
Отдельный случай — код 200 с пустой страницей или страницей-заглушкой. Формально все в порядке, но индексировать нечего.
Медленный ответ снижает объем обхода. Если сервер отвечает дольше 2–3 секунд, робот за визит успевает меньше страниц, и большой сайт индексируется месяцами. Время первого байта видно в Вебмастере в разделе «Скорость обхода».
Робот не знает о страницах. Поисковик находит страницы двумя путями: по ссылкам с других страниц и по карте сайта sitemap.xml. Если на страницу не ведет ни одна ссылка и ее нет в карте, робот о ней не узнает.
Типичный пример — карточки товаров, доступные только через фильтр или поиск по сайту. Человек их находит, робот — нет: он не заполняет формы и не нажимает кнопки.
Проверьте, что карта сайта существует, указана в robots.txt директивой Sitemap: и добавлена в Вебмастер и Search Console. В карту включают только страницы, открытые для индексации и отвечающие кодом 200.
Причины 5–6: canonical, редиректы и дубли
Canonical и редиректы уводят робота в сторону. Тег rel="canonical" говорит поисковику, какую версию страницы считать основной. Если по ошибке на всех страницах указан адрес главной, поисковик сочтет их копиями главной и в базу не возьмет. Статус в отчетах — «Страница является копией» или «Неканоническая страница».
Похоже работает редирект: если адрес постоянно перенаправляет на другой, индексироваться будет конечная страница. Цепочка из нескольких перенаправлений подряд расходует обход и может оборваться.
Проверьте на нескольких страницах, что canonical указывает на них самих, и что нужные адреса отвечают кодом 200, а не 301.
Дубли и мало собственного содержания. Если страница повторяет другую — например, описание товара скопировано у поставщика и есть еще на сотне сайтов, — поисковик может не брать ее в базу. В Search Console это статус «Страница с дублирующимся контентом», в Вебмастере — «Дубль».
Тот же эффект дают технические дубли: один товар доступен по нескольким адресам с параметрами сортировки и фильтров. Поисковик выбирает один адрес, остальные исключает.
Лечится это не запретами, а содержанием: свой текст, свои фотографии, характеристики и ответы на вопросы покупателей. Технические дубли убирают через canonical и Clean-param.
Причины 7–9: скрипты, закрытый доступ и санкции
Содержание появляется только через JavaScript. Если текст и ссылки подгружаются скриптами, робот может увидеть пустую страницу. Google выполняет JavaScript, но с задержкой и не всегда полностью; для Яндекса это еще менее предсказуемо.
Проверить можно так: откройте страницу и посмотрите исходный код (Ctrl+U). Если в нем нет вашего текста и ссылок на другие страницы — робот их тоже не увидит без выполнения скриптов.
Решение — отдавать содержание в HTML: серверный рендеринг или пререндер для роботов. Меню и ссылки должны быть обычными тегами <a href>, а не обработчиками нажатия.
Сайт закрыт паролем, регионом или защитой от ботов. Базовая HTTP-авторизация на тестовой площадке, форма входа перед содержимым, ограничение по стране, капча при первом заходе — во всех случаях робот получает не страницу, а запрет.
Защита от ботов у хостинга или Cloudflare иногда принимает роботов Яндекса и Google за вредителей и отвечает кодом 403. В Вебмастере это видно в разделе «Статистика обхода» по коду ответа.
Проверьте в Вебмастере инструментом «Проверка ответа сервера», что робот получает код 200 и видит содержимое страницы. Этот инструмент запрашивает страницу от имени робота Яндекса, а не из вашего браузера.
Санкции и аффилиаты. Если сайт нарушает правила поисковой системы — скрытый текст, автоматические тексты, накрутка поведенческих факторов, — он может быть исключен из базы целиком. Яндекс сообщает об этом в Вебмастере в разделе «Диагностика → Безопасность и нарушения», Google — в отчете «Меры, принятые вручную».
Отдельно стоит случай, когда у компании несколько сайтов с одним и тем же предложением. Поисковик считает их аффилиатами и оставляет в результатах один.
Это самая редкая причина: сначала проверьте восемь предыдущих. Но если в Вебмастере есть уведомление о нарушении, все остальное не имеет смысла, пока оно не снято.
Как проверить результат
Пройдите четыре шага по порядку. Первый: откройте https://example.ru/robots.txt и убедитесь, что нужные разделы не закрыты директивой Disallow. Второй: проверьте исходный код главной и типовой внутренней страницы на noindex и на то, что текст есть в HTML.
Третий: в Яндекс Вебмастере откройте «Индексирование → Страницы в поиске» и переключитесь на «Исключенные» — там указана причина по каждому адресу. В Google Search Console то же самое дает отчет «Индексирование страниц».
Четвертый: возьмите один непроиндексированный адрес и прогоните его через «Проверку ответа сервера» в Вебмастере и «Проверку URL» в Search Console. Оба инструмента показывают, что именно видит робот.
Проверка сайта в SEO title обходит сайт как поисковый робот и собирает все девять причин сразу: запреты в robots.txt и метатегах, коды ответа, canonical, дубли, пустые после отключения скриптов страницы. В отчете каждая проблема идет со списком адресов, поэтому не нужно перебирать страницы вручную.
После исправления отправьте страницы на переобход: в Вебмастере — «Индексирование → Переобход страниц», в Search Console — кнопка «Проверить URL» и «Запросить индексирование». Результата ждите от нескольких дней до двух недель.
Первоисточники
FAQ
Частые вопросы
С чего начать, если важная страница пропала из поиска?
Проверьте её текущий статус в Вебмастере или Search Console, код ответа и возможность обхода. Дата последней проверки роботом поможет понять, видел ли он исправления.
Если robots.txt и noindex в порядке, страницу обязаны включить в поиск?
Нет. Техническая доступность лишь убирает часть причин исключения; поисковик отдельно оценивает содержание и полезность страницы.
Когда отправлять URL на переобход?
После реального исправления причины: например, открытия доступа, устранения редиректа или существенного улучшения содержания. Сам запрос переобхода не гарантирует индексацию.
Проверьте себя
Вопрос 1 из 2. Результат увидите только вы.
Обсуждение
Что вы уже проверили, если сайт или его важные страницы не появляются в поиске?
Войдите, чтобы оставить комментарий. Читать обсуждение могут все. Комментарии проходят автоматическую и редакционную проверку.