Индексность страницы: robots, noindex, canonical

Почему страница не попадает в поиск

Вы создали полезную статью, оптимизировали title и description, но страница не появляется в результатах поиска Яндекса или Google. Почему?

Страница может быть закрыта от индексации одним из нескольких способов:
1. robots.txt — директива Disallow
2. Meta robots — тег <meta name="robots" content="noindex">
3. X-Robots-Tag — HTTP-заголовок X-Robots-Tag: noindex
4. Canonical — canonical указывает на другую страницу
5. 301 редирект — страница перенаправляется на другую

Если хотя бы один из этих факторов присутствует — страница не будет индексироваться (или будет индексироваться не как самостоятельная).

МеханизмЧто делаетКогда применять
robots.txt DisallowПросит робота не обходить URL; сам по себе не гарантирует исключение из индексаСлужебные разделы и снижение лишнего обхода
noindexИсключает доступную страницу из поиска после её обходаФильтры, внутренние результаты поиска, дубли
canonicalПодсказывает предпочитаемую версию похожих страницПараметры, вариации и дубли контента

Robots.txt — первый барьер

Как robots.txt блокирует индексацию

Директива Disallow в robots.txt говорит роботу не посещать страницу. Если робот не посещает страницу, он не может её проиндексировать.

User-agent: *
Disallow: /private/

Страница /private/secret/ будет закрыта от всех поисковиков.

Нюанс: Disallow ≠ noindex

  • Disallow — робот не посещает страницу, но URL может быть проиндексирован, если о нём узнали из других источников
  • Noindex — робот посещает страницу, но не индексирует её

Рекомендация: для закрытия страниц от индексации используйте noindex, не Disallow. Disallow используйте только для служебных директорий (/admin/, /tmp/).

Meta robots — тег в HTML

Базовый noindex

<meta name="robots" content="noindex" />

Этот тег говорит всем поисковикам не индексировать страницу.

noindex, follow

<meta name="robots" content="noindex, follow" />

Страница не индексируется, но ссылки на ней передают вес. Это полезно для страниц пагинации, которые нужно проиндексировать, но не показывать в выдаче.

noindex, nofollow

<meta name="robots" content="noindex, nofollow" />

Страница не индексируется, и ссылки на ней не передают вес. Используйте для страниц, которые не должны передавать ссылочный вес (например, страницы с пользовательским контентом).

Index, follow — явное разрешение

<meta name="robots" content="index, follow" />

Обычно не нужен — это поведение по умолчанию. Но может быть полезен, если предыдущая страница имеет noindex, а текущая должна быть проиндексирована.

X-Robots-Tag — HTTP-заголовок

Когда использовать

X-Robots-Tag — это HTTP-заголовок, который работает так же, как meta robots, но на уровне сервера. Полезен для:

  • PDF и других файлов — meta robots в HTML не работает для PDF
  • Всех страниц — если вы не используете CMS для управления meta robots
  • Глобальных правил — например, закрыть все PDF от индексации

Пример

X-Robots-Tag: noindex

Или для конкретных типов файлов:

# nginx
location ~* \.(pdf|doc|docx)$ {
    add_header X-Robots-Tag "noindex, nofollow";
}

Canonical — косвенная блокировка индексации

Как canonical влияет на индексацию

Если canonical страницы указывает на другой URL — поисковик считает эту страницу дублем и индексирует только канонический URL.

Пример:

  • Страница /about/ имеет canonical на /about-us/
  • Поисковик индексирует /about-us/, а /about/ — нет

Это нормально, если /about/ и /about-us/ — дубли. Но если /about/ — уникальная страница с canonical на / — это ошибка.

301 редирект — страница перемещена

Как 301 влияет на индексацию

Если страница отдаёт 301 редирект на другой URL — поисковик понимает, что страница перемещена, и передаёт ссылочный вес на новый URL. Старый URL исключается из индекса.

Пример:

  • /old-page/ → 301 → /new-page/
  • /old-page/ исключается из индекса
  • /new-page/ получает весь ссылочный вес

Как проверить индексацию страницы

1. Через поисковик

site:example.ru/page/

Если страница в результатах — она проиндексирована. Если нет — проверьте ниже.

2. Через Яндекс.Вебмастер

Раздел «Переобход страниц» → введите URL → проверьте статус.

3. Через Google Search Console

Раздел «Проверка URL» → введите URL → посмотрите статус индексации.

4. Через curl

# Проверить meta robots
curl -sL 'https://example.ru/page/' | grep -oP 'name="robots"\s+content="\K[^"]+'

# Проверить X-Robots-Tag
curl -sI 'https://example.ru/page/' | grep -i 'x-robots-tag'

# Проверить canonical
curl -sL 'https://example.ru/page/' | grep -oP 'rel="canonical"[^>]+href="\K[^"]+'

# Проверить HTTP-код
curl -sI 'https://example.ru/page/' | head -1

Частые причины отсутствия страницы в индексе

1. Noindex

Страница имеет <meta name="robots" content="noindex">. Это может быть намеренно (страницы пагинации) или ошибочно (важные страницы закрыты).

Решение: уберите noindex с важных страниц.

2. Disallow в robots.txt

Страница закрыта в robots.txt. Робот не посещает страницу и не может её проиндексировать.

Решение: уберите страницу из Disallow, если она важна.

3. Canonical на другую страницу

Страница имеет canonical, указывающий на другой URL. Поисковик считает её дублем.

Решение: проверьте, что canonical указывает на self-referencing URL.

4. Страница не посещена роботом

Если на страницу нет внутренних ссылок, робот может её не найти.

Решение: добавьте ссылки из навигации или контента. Или укажите в sitemap.

5. Страница слишком новая

Поисковику нужно время, чтобы найти и проиндексировать новую страницу. Обычно это занимает от нескольких часов до нескольких дней.

Решение: отправьте URL на переобход через Вебмастер/Search Console.

6. Страница с тонким контентом

Поисковики могут не индексировать страницы с очень коротким или дублирующимся контентом.

Решение: дополните контент или объедините с другой страницей.

Индексация и Health Score

В Health Score seoquest.ru индексация — один из ключевых параметров:

  • robots, noindex, canonical — проверка закрытия от индексации
  • Страницы в индексе — сравнение количества проиндексированных страниц с ожидаемым
  • Индексация важных страниц — проверка, что коммерческие страницы проиндексированы

Чеклист индексации

  • [ ] Страница не закрыта в robots.txt (Disallow)
  • [ ] Нет meta robots noindex
  • [ ] Нет X-Robots-Tag noindex
  • [ ] Canonical указывает на self-referencing URL
  • [ ] Страница отдаёт HTTP 200
  • [ ] Страница есть в sitemap
  • [ ] На страницу есть внутренние ссылки
  • [ ] Страница проиндексирована (проверка через site:)

Итог

Индексация — фундамент SEO. Если страница не проиндексирована, она не может ранжироваться. Проверяйте robots.txt, meta robots, X-Robots-Tag и canonical на каждой важной странице. Используйте инструменты Яндекс.Вебмастера и Google Search Console для контроля индексации.

Проверить сайт по техническим и контентным пунктам можно в бесплатной проверке.

Когда уместен noindex

Мета noindex (или X-Robots-Tag) — страница может открываться людям, но не должна быть в поиске: служебный поиск, тонкая пагинация, личные кабинеты, черновики. Это не замена Disallow в robots.txt: при noindex робот обычно всё же загружает URL, при Disallow — может не ходить, но URL иногда «висит» в выдаче без сниппета.

Перенос страницы = чаще 301, а не noindex «на всякий случай».

Hreflang (если сайт мультиязычный)

Hreflang — как сказать поисковику, какой язык у страницы

Hreflang — это тег, который говорит поисковику: «Эта страница на русском, а эта — на английском».

Как работает

<link rel="alternate" hreflang="ru" href="https://example.ru/" />
<link rel="alternate" hreflang="en" href="https://example.com/" />
<link rel="alternate" hreflang="x-default" href="https://example.com/" />

Правила hreflang

  1. Каждая страница должна ссылаться на все языковые версии
  2. Каждая версия должна ссылаться на все остальные
  3. x-default — версия по умолчанию для пользователей без выбора языка
  4. Коды языков: ISO 639-1 (ru, en, de)

Частые ошибки

  1. Пропущенная обратная ссылка
  2. Hreflang на 404-странице
  3. Неправильные коды языков

Итог

Если у вас мультиязычный сайт — настройте hreflang. Если нет — эта статья не для вас.

Вопросы и ответы

Noindex и Disallow — в чём разница?

Noindex говорит роботу не индексировать страницу, но разрешает посещение. Disallow запрещает посещение. Для закрытия страниц от индексации используйте noindex, не Disallow.

Can canonical закрыть страницу от индексации?

Косвенно — да. Если canonical указывает на другую страницу, поисковик считает страницу дублем и индексирует только канонический URL. Но страница всё равно будет посещена роботом.

Как быстро страница попадёт в индекс?

Зависит от авторитетности сайта и частоты обхода. На авторитетных сайтах — от нескольких часов до дня. На новых — от нескольких дней до двух недель. Ускорить можно через Вебмастер/Search Console.

X-Robots-Tag работает для HTML-страниц?

Да, X-Robots-Tag работает для всех типов файлов, включая HTML. Но для HTML-страниц проще использовать meta robots в <head>.

Можно ли удалить страницу из индекса?

Да, добавьте noindex и отправьте URL на переобход. Поисковик удалит страницу из индекса в течение нескольких дней. Или настройте 301 редирект на другую страницу.