Дубли
Clean-param: как убрать дубли страниц с параметрами в Яндексе
Один товар или раздел часто открывается по десяткам адресов: с сортировкой, фильтром, рекламной меткой. Для человека это одна страница, для поискового робота — разные. Объясняем, когда это проблема и как её решить через Clean-param в Яндексе и canonical в Google.
Откуда берутся дубли с параметрами
Адрес страницы может заканчиваться «хвостом» после знака вопроса — это GET-параметры: ?sort=price, ?utm_source=vk. Их добавляют сортировка, фильтры, рекламные метки и счётчики. Если содержимое страницы при этом не меняется, робот видит несколько адресов одной и той же страницы — это и есть дубли.
В интернет-магазине таких вариантов бывают тысячи. Позиции от этого сами по себе не падают, но робот тратит время на копии и может выбрать для поиска не тот адрес.
Что делает Clean-param
Clean-param — строка в файле robots.txt, которую понимает только Яндекс. Она говорит роботу: «эти параметры не меняют страницу, считай такие адреса одним». Похожая настройка есть и в Яндекс Вебмастере, поэтому по одному robots.txt нельзя утверждать, что параметры не настроены.
Добавляйте только те параметры, влияние которых проверено. Параметр фильтра по цвету или городу может создавать отдельную полезную страницу и не должен считаться служебным автоматически.
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign /catalog/Как найти опасные варианты URL
Соберите адреса из обхода сайта, карты сайта (sitemap) и Яндекс Вебмастера. Сгруппируйте их по пути без параметров и сравните: код ответа, canonical, заголовок для поиска (title), главный заголовок (H1) и текст.
SEO-краулер помогает найти повторяющиеся страницы, но решение о параметре принимает специалист: одинаковый шаблон ещё не доказывает, что назначение страниц совпадает.
- Рекламные метки: utm_source, utm_medium, utm_campaign, yclid
- Сортировка и представление: sort, order, view
- Служебные параметры: from, ref и идентификаторы сессии
- Фильтры каталога — только после проверки поискового спроса и содержимого
Что сделать для Google
Google не понимает Clean-param. Ему нужны ссылки внутри сайта на основной адрес и тег canonical — строка в коде страницы, которая указывает её основную версию.
Canonical — подсказка, а не приказ. Не закрывайте такие адреса в robots.txt: робот не сможет открыть страницу и не увидит canonical.
Как проверить результат
После изменения robots.txt проверьте несколько URL в Яндекс Вебмастере и повторите обход сайта. Следите не только за количеством найденных вариантов, но и за тем, какие адреса поисковик продолжает обходить и показывать в поиске.
Изменения проявляются после повторного обхода. Техническая настройка уменьшает неоднозначность, но сама по себе не гарантирует исключения URL или рост позиций.