Индексация

Сайт не индексируется: 9 причин и как проверить

Иллюстрация к статье «Сайт не индексируется: 9 причин и как проверить»
В избранное — зарегистрироватьсяНравится — зарегистрироваться

Если сайт не индексируется, его страниц нет в базе поисковой системы — и по любому запросу их не покажут. Причин ровно девять, и восемь из них видно в Яндекс Вебмастере и Google Search Console за десять минут. Разбираем каждую: что происходит, как проверить самому и что покажет проверка сайта.

Что значит «сайт не индексируется»

Индексация — это добавление страницы в базу поисковой системы. Сначала робот обходит страницу (краулинг), затем решает, брать ли ее в базу (индексирование), и только после этого страница может появиться в результатах поиска.

Отсюда три разных состояния, которые часто путают. Робот не заходил на страницу — проблема с обходом. Робот зашел, но страницу не взял — проблема с индексированием. Страница в базе, но ее не показывают по запросам — это уже вопрос ранжирования, а не индексации.

Первый шаг — понять, какое из трех состояний у вас. В Яндекс Вебмастере это раздел «Индексирование → Страницы в поиске», в Google Search Console — отчет «Индексирование страниц». Оба показывают причину по каждому адресу.

Молодому сайту нужно время: первые страницы обычно появляются за срок от нескольких дней до 2–3 недель. Если сайту меньше недели и в Вебмастере нет ошибок, ждите.

Причины 1–2: запреты в robots.txt и метатеге noindex

Запрет в robots.txt. Самая частая причина: в файле https://example.ru/robots.txt осталась строка Disallow: / — так закрывают сайт на время разработки и забывают открыть после запуска.

Робот читает этот файл перед обходом и просто не заходит на закрытые адреса. В Вебмастере такие страницы получают статус «Запрещен в robots.txt», в Search Console — «Заблокировано в файле robots.txt».

Проверить просто: откройте адрес файла в браузере и найдите строки Disallow. Убедитесь, что закрыты только служебные разделы — корзина, поиск по сайту, личный кабинет.

Метатег noindex или заголовок X-Robots-Tag. Второй по частоте запрет живет в коде страницы: <meta name="robots" content="noindex">. Робот страницу открывает, читает запрет и не берет ее в базу. В отчетах это выглядит как «Исключена по тегу noindex».

Тот же запрет может приходить в HTTP-заголовке X-Robots-Tag: noindex — его в коде страницы не видно, он отдается сервером. Так часто настраивают тестовые площадки, а потом копируют конфигурацию на боевой сайт.

Отдельная ловушка у популярных CMS: в WordPress есть галочка «Попросить поисковые системы не индексировать сайт», в 1С-Битрикс и Tilda — похожие настройки в разделе публикации. Галочка ставит noindex на весь сайт.

# посмотреть заголовки ответа
curl -sI https://example.ru/ | grep -i x-robots-tag

Причины 3–4: сервер отвечает плохо или робот не знает о страницах

Сервер отвечает ошибкой или слишком медленно. Если на запрос робота сервер отвечает кодом 5xx, страница в базу не попадет: для поисковика ее содержимого не существует. Коды 4xx означают, что страницы нет, — такие адреса тоже исключаются.

Отдельный случай — код 200 с пустой страницей или страницей-заглушкой. Формально все в порядке, но индексировать нечего.

Медленный ответ снижает объем обхода. Если сервер отвечает дольше 2–3 секунд, робот за визит успевает меньше страниц, и большой сайт индексируется месяцами. Время первого байта видно в Вебмастере в разделе «Скорость обхода».

Робот не знает о страницах. Поисковик находит страницы двумя путями: по ссылкам с других страниц и по карте сайта sitemap.xml. Если на страницу не ведет ни одна ссылка и ее нет в карте, робот о ней не узнает.

Типичный пример — карточки товаров, доступные только через фильтр или поиск по сайту. Человек их находит, робот — нет: он не заполняет формы и не нажимает кнопки.

Проверьте, что карта сайта существует, указана в robots.txt директивой Sitemap: и добавлена в Вебмастер и Search Console. В карту включают только страницы, открытые для индексации и отвечающие кодом 200.

Причины 5–6: canonical, редиректы и дубли

Canonical и редиректы уводят робота в сторону. Тег rel="canonical" говорит поисковику, какую версию страницы считать основной. Если по ошибке на всех страницах указан адрес главной, поисковик сочтет их копиями главной и в базу не возьмет. Статус в отчетах — «Страница является копией» или «Неканоническая страница».

Похоже работает редирект: если адрес постоянно перенаправляет на другой, индексироваться будет конечная страница. Цепочка из нескольких перенаправлений подряд расходует обход и может оборваться.

Проверьте на нескольких страницах, что canonical указывает на них самих, и что нужные адреса отвечают кодом 200, а не 301.

Дубли и мало собственного содержания. Если страница повторяет другую — например, описание товара скопировано у поставщика и есть еще на сотне сайтов, — поисковик может не брать ее в базу. В Search Console это статус «Страница с дублирующимся контентом», в Вебмастере — «Дубль».

Тот же эффект дают технические дубли: один товар доступен по нескольким адресам с параметрами сортировки и фильтров. Поисковик выбирает один адрес, остальные исключает.

Лечится это не запретами, а содержанием: свой текст, свои фотографии, характеристики и ответы на вопросы покупателей. Технические дубли убирают через canonical и Clean-param.

Причины 7–9: скрипты, закрытый доступ и санкции

Содержание появляется только через JavaScript. Если текст и ссылки подгружаются скриптами, робот может увидеть пустую страницу. Google выполняет JavaScript, но с задержкой и не всегда полностью; для Яндекса это еще менее предсказуемо.

Проверить можно так: откройте страницу и посмотрите исходный код (Ctrl+U). Если в нем нет вашего текста и ссылок на другие страницы — робот их тоже не увидит без выполнения скриптов.

Решение — отдавать содержание в HTML: серверный рендеринг или пререндер для роботов. Меню и ссылки должны быть обычными тегами <a href>, а не обработчиками нажатия.

Сайт закрыт паролем, регионом или защитой от ботов. Базовая HTTP-авторизация на тестовой площадке, форма входа перед содержимым, ограничение по стране, капча при первом заходе — во всех случаях робот получает не страницу, а запрет.

Защита от ботов у хостинга или Cloudflare иногда принимает роботов Яндекса и Google за вредителей и отвечает кодом 403. В Вебмастере это видно в разделе «Статистика обхода» по коду ответа.

Проверьте в Вебмастере инструментом «Проверка ответа сервера», что робот получает код 200 и видит содержимое страницы. Этот инструмент запрашивает страницу от имени робота Яндекса, а не из вашего браузера.

Санкции и аффилиаты. Если сайт нарушает правила поисковой системы — скрытый текст, автоматические тексты, накрутка поведенческих факторов, — он может быть исключен из базы целиком. Яндекс сообщает об этом в Вебмастере в разделе «Диагностика → Безопасность и нарушения», Google — в отчете «Меры, принятые вручную».

Отдельно стоит случай, когда у компании несколько сайтов с одним и тем же предложением. Поисковик считает их аффилиатами и оставляет в результатах один.

Это самая редкая причина: сначала проверьте восемь предыдущих. Но если в Вебмастере есть уведомление о нарушении, все остальное не имеет смысла, пока оно не снято.

Как проверить результат

Пройдите четыре шага по порядку. Первый: откройте https://example.ru/robots.txt и убедитесь, что нужные разделы не закрыты директивой Disallow. Второй: проверьте исходный код главной и типовой внутренней страницы на noindex и на то, что текст есть в HTML.

Третий: в Яндекс Вебмастере откройте «Индексирование → Страницы в поиске» и переключитесь на «Исключенные» — там указана причина по каждому адресу. В Google Search Console то же самое дает отчет «Индексирование страниц».

Четвертый: возьмите один непроиндексированный адрес и прогоните его через «Проверку ответа сервера» в Вебмастере и «Проверку URL» в Search Console. Оба инструмента показывают, что именно видит робот.

Проверка сайта в SEO title обходит сайт как поисковый робот и собирает все девять причин сразу: запреты в robots.txt и метатегах, коды ответа, canonical, дубли, пустые после отключения скриптов страницы. В отчете каждая проблема идет со списком адресов, поэтому не нужно перебирать страницы вручную.

После исправления отправьте страницы на переобход: в Вебмастере — «Индексирование → Переобход страниц», в Search Console — кнопка «Проверить URL» и «Запросить индексирование». Результата ждите от нескольких дней до двух недель.

Первоисточники

FAQ

Частые вопросы

С чего начать, если важная страница пропала из поиска?

Проверьте её текущий статус в Вебмастере или Search Console, код ответа и возможность обхода. Дата последней проверки роботом поможет понять, видел ли он исправления.

Если robots.txt и noindex в порядке, страницу обязаны включить в поиск?

Нет. Техническая доступность лишь убирает часть причин исключения; поисковик отдельно оценивает содержание и полезность страницы.

Когда отправлять URL на переобход?

После реального исправления причины: например, открытия доступа, устранения редиректа или существенного улучшения содержания. Сам запрос переобхода не гарантирует индексацию.

Проверьте себя

Вопрос 1 из 2. Результат увидите только вы.

С чего полезно начать диагностику отсутствия страницы в поиске?

Обсуждение

Что вы уже проверили, если сайт или его важные страницы не появляются в поиске?

Войдите, чтобы оставить комментарий. Читать обсуждение могут все. Комментарии проходят автоматическую и редакционную проверку.