wpapp.ru wordpress wpapp.ru

Как закрыть дубли страниц в WordPress от индексации без поломки SEO

В WordPress дубли чаще всего появляются не из-за «плохого SEO», а из-за стандартной логики CMS: архивы рубрик и тегов, страницы пагинации, вложенные таксономии, версии с параметрами ?replytocom, ?amp, сортировки и фильтров. Если это не контролировать, поисковик тратит обход на мусорные URL, а в индексе появляются страницы, которые не должны конкурировать с основными.

Ниже — рабочая схема, как найти такие URL, закрыть их от индексации и не сломать полезные разделы сайта.

Когда проблема уже есть: как это выглядит в поиске и в аналитике

Проверять нужно не только метатеги. Дубли обычно всплывают в трех местах: в отчете по страницам в Google Search Console, в логах обхода, а также в результатах поиска по оператору site:. Типичный признак — в выдаче есть и основная страница рубрики, и ее пагинация, и теги, которые дублируют тот же набор материалов.

Если сайт небольшой, проблема может быть незаметной. На контентных проектах и блогах с активной таксономией она быстро становится системной: индекс разрастается, а полезные страницы получают меньше внимания краулера.

Что именно искать в первую очередь

  • архивы тегов, если они дублируют рубрики или не несут самостоятельной ценности;
  • страницы автора на сайтах с одним автором;
  • служебные URL с параметрами сортировки, фильтров и комментариев;
  • страницы пагинации, если они не должны ранжироваться отдельно;
  • внутренний поиск сайта;
  • медиа-страницы вложений, если они не используются как отдельные посадочные.

Диагностика: какие URL реально попадают в индекс

Сначала не трогаем настройки. Сначала смотрим, что уже проиндексировано и что доступно для обхода.

  1. Откройте Google Search Console и проверьте разделы «Страницы» и «Проверка URL».
  2. Сделайте выборку через site:вашдомен.ru по типам URL: tag, author, page/, параметры.
  3. Посмотрите, нет ли в sitemap лишних архивов и служебных страниц.
  4. Проверьте исходный код проблемных страниц: есть ли noindex, canonical и корректные заголовки.

Если у вас есть доступ к серверным логам, полезно посмотреть, как часто бот ходит на дубли. Это особенно важно, когда сайт большой и краулинговый бюджет ограничен.

Пошаговое решение: что закрывать, а что оставлять

Универсального списка нет. Логика простая: если страница не дает самостоятельной ценности пользователю и не нужна для поиска внутри сайта, ее можно закрывать от индексации или вообще исключать из sitemap.

ВариантКогда подходитКомпромисс
Плагин SEO/чисткиНужно быстро закрыть типовые архивы и параметры без кодаМеньше гибкости, важно не задеть полезные разделы
Код в теме или мини-плагинеНужна точечная настройка под конкретный сайтТребует тестирования после обновлений
Комбинированный подходЧасть дублей закрывается плагином, часть — кодомНужно следить, чтобы правила не конфликтовали

1. Закрываем ненужные архивы от индексации

Если на сайте один автор, архив автора обычно не нужен в индексе. То же касается тегов, когда они просто повторяют рубрики. Для таких случаев лучше использовать noindex,follow, а не удалять страницу полностью: поисковый робот сможет пройти по ссылкам, но сама страница не будет ранжироваться.

В WordPress это можно сделать через SEO-плагин или кодом. Если нужен именно кодовый вариант, логика зависит от темы и плагина SEO, но общий принцип такой: на проблемных архивах выводится мета robots с noindex.

<?php
add_action('wp_head', function () {
    if (is_tag() || is_author()) {
        echo '<meta name="robots" content="noindex,follow">' . "\n";
    }
});

Это пример для понимания механики. В реальном проекте лучше не дублировать robots-теги, если их уже выводит SEO-плагин.

2. Убираем медиа-страницы вложений

Медиа-страницы часто индексируются отдельно, хотя на практике они почти не нужны. Если у вас нет отдельного сценария для attachment-страниц, безопаснее редиректить их на сам файл или родительскую запись.

<?php
add_action('template_redirect', function () {
    if (is_attachment()) {
        $parent = wp_get_post_parent_id(get_the_ID());
        if ($parent) {
            wp_redirect(get_permalink($parent), 301);
            exit;
        }
    }
});

Если родителя нет, можно отправлять на главную медиафайла или на архив, но это уже зависит от структуры сайта.

3. Чистим параметры URL и служебные страницы

Параметры вроде ?replytocom или технических фильтров могут плодить дубли. Если они не нужны для SEO, их лучше не пускать в индекс и по возможности не генерировать лишние ссылки на них внутри шаблонов.

Отдельно проверьте внутренний поиск WordPress: страницы вида /?s=... почти никогда не должны индексироваться. Для них обычно ставят noindex и исключают из sitemap.

Настройка через плагин или код: что выбрать

Если задача типовая, быстрее всего закрыть дубли через SEO-плагин или плагин для технической чистки. Если нужна точная логика по типам записей, таксономиям и архивам, лучше вынести правила в код или в небольшой mu-plugin.

Например, в Clearfy Pro есть инструменты для технической чистки и управления дублями, но использовать их стоит только после проверки, какие именно страницы вам нужны в индексе. Слепое отключение архивов часто ломает навигацию и внутреннюю перелинковку. Подробности по продукту есть на странице Clearfy Pro.

Проверка результата после внедрения

После изменений не ограничивайтесь просмотром кода страницы. Нужно проверить, что поисковик видит именно то, что вы задумали.

  • Откройте проблемный URL и проверьте мета robots.
  • Посмотрите canonical: он должен указывать на основную страницу, а не на дубль.
  • Проверьте sitemap: туда не должны попадать закрытые архивы и служебные URL.
  • В Search Console отправьте страницу на повторную проверку.
  • Через несколько дней сравните количество проиндексированных дублей по операторам site: и по отчету «Страницы».

Если вы закрывали архивы через noindex, не ждите мгновенного исчезновения из индекса. Поисковику нужно время, чтобы переобойти URL и обновить состояние.

Частые ошибки и как их исправить

Ставят noindex на полезные страницы

Это самая дорогая ошибка. Иногда под раздачу попадают рубрики, которые реально приводят трафик, или страницы пагинации, на которых есть уникальные материалы. Перед закрытием проверьте, есть ли у URL самостоятельный спрос и внешние переходы.

Закрывают страницу, но оставляют ее в sitemap

Так делать не стоит. Sitemap должен отражать только те URL, которые вы хотите индексировать. Иначе вы отправляете поисковику противоречивые сигналы.

Используют robots.txt вместо noindex

Запрет в robots.txt не гарантирует удаление из индекса, если URL уже известен поисковику. Для дублей обычно нужен именно noindex или редирект, а не только блокировка обхода.

Делают 301-редирект на главную без логики

Это плохая замена для всех случаев. Если у страницы есть близкий по смыслу аналог, редирект должен вести туда. На главную можно отправлять только то, что действительно не имеет замены.

Чек-лист перед публикацией изменений

  • Проверены все типы архивов: рубрики, теги, авторы, даты.
  • Служебные URL с параметрами не попадают в индекс.
  • Медиа-страницы либо редиректятся, либо закрыты.
  • Canonical указывает на основную страницу.
  • Sitemap очищен от дублей.
  • Внутренние ссылки не ведут массово на закрытые URL.
  • После правок сделана повторная проверка в Search Console.

Что еще стоит учесть для скорости и безопасности

Чем меньше мусорных URL генерирует сайт, тем проще ему жить: меньше лишних обходов, меньше нагрузки на сервер, меньше шансов, что в индексе останутся устаревшие версии страниц. Если вы правите код, делайте это в дочерней теме или в отдельном мини-плагине, а не в файлах родительской темы. Так обновление не затрет изменения.

Если используете несколько SEO- или cache-плагинов, проверьте, не дублируют ли они друг друга: два разных механизма для canonical, robots или редиректов часто создают конфликт. В таких проектах лучше сначала отключить лишнее на тестовой копии и только потом переносить на боевой сайт.

Для сложных сайтов полезно вести короткий список правил: какие архивы индексируются, какие закрыты, какие URL редиректятся. Это экономит время, когда через полгода кто-то снова включит тег-архивы или поменяет шаблон пагинации.

×

AI-плагин

WPGPT
Сам создает статьи для вашего сайта WordPress

SEO и мета-теги

Парсинг конкурентов

Изображения

Комментарии

Подробнее