Почему страница не попадает в поиск
Вы создали полезную статью, оптимизировали title и description, но страница не появляется в результатах поиска Яндекса или Google. Почему?
Страница может быть закрыта от индексации одним из нескольких способов:
1. robots.txt — директива Disallow
2. Meta robots — тег <meta name="robots" content="noindex">
3. X-Robots-Tag — HTTP-заголовок X-Robots-Tag: noindex
4. Canonical — canonical указывает на другую страницу
5. 301 редирект — страница перенаправляется на другую
Если хотя бы один из этих факторов присутствует — страница не будет индексироваться (или будет индексироваться не как самостоятельная).
| Механизм | Что делает | Когда применять |
|---|---|---|
robots.txt Disallow | Просит робота не обходить URL; сам по себе не гарантирует исключение из индекса | Служебные разделы и снижение лишнего обхода |
noindex | Исключает доступную страницу из поиска после её обхода | Фильтры, внутренние результаты поиска, дубли |
canonical | Подсказывает предпочитаемую версию похожих страниц | Параметры, вариации и дубли контента |
Robots.txt — первый барьер
Как robots.txt блокирует индексацию
Директива Disallow в robots.txt говорит роботу не посещать страницу. Если робот не посещает страницу, он не может её проиндексировать.
User-agent: *
Disallow: /private/
Страница /private/secret/ будет закрыта от всех поисковиков.
Нюанс: Disallow ≠ noindex
- Disallow — робот не посещает страницу, но URL может быть проиндексирован, если о нём узнали из других источников
- Noindex — робот посещает страницу, но не индексирует её
Рекомендация: для закрытия страниц от индексации используйте noindex, не Disallow. Disallow используйте только для служебных директорий (/admin/, /tmp/).
Meta robots — тег в HTML
Базовый noindex
<meta name="robots" content="noindex" />
Этот тег говорит всем поисковикам не индексировать страницу.
noindex, follow
<meta name="robots" content="noindex, follow" />
Страница не индексируется, но ссылки на ней передают вес. Это полезно для страниц пагинации, которые нужно проиндексировать, но не показывать в выдаче.
noindex, nofollow
<meta name="robots" content="noindex, nofollow" />
Страница не индексируется, и ссылки на ней не передают вес. Используйте для страниц, которые не должны передавать ссылочный вес (например, страницы с пользовательским контентом).
Index, follow — явное разрешение
<meta name="robots" content="index, follow" />
Обычно не нужен — это поведение по умолчанию. Но может быть полезен, если предыдущая страница имеет noindex, а текущая должна быть проиндексирована.
X-Robots-Tag — HTTP-заголовок
Когда использовать
X-Robots-Tag — это HTTP-заголовок, который работает так же, как meta robots, но на уровне сервера. Полезен для:
- PDF и других файлов — meta robots в HTML не работает для PDF
- Всех страниц — если вы не используете CMS для управления meta robots
- Глобальных правил — например, закрыть все PDF от индексации
Пример
X-Robots-Tag: noindex
Или для конкретных типов файлов:
# nginx
location ~* \.(pdf|doc|docx)$ {
add_header X-Robots-Tag "noindex, nofollow";
}
Canonical — косвенная блокировка индексации
Как canonical влияет на индексацию
Если canonical страницы указывает на другой URL — поисковик считает эту страницу дублем и индексирует только канонический URL.
Пример:
- Страница
/about/имеет canonical на/about-us/ - Поисковик индексирует
/about-us/, а/about/— нет
Это нормально, если /about/ и /about-us/ — дубли. Но если /about/ — уникальная страница с canonical на / — это ошибка.
301 редирект — страница перемещена
Как 301 влияет на индексацию
Если страница отдаёт 301 редирект на другой URL — поисковик понимает, что страница перемещена, и передаёт ссылочный вес на новый URL. Старый URL исключается из индекса.
Пример:
/old-page/→ 301 →/new-page//old-page/исключается из индекса/new-page/получает весь ссылочный вес
Как проверить индексацию страницы
1. Через поисковик
site:example.ru/page/
Если страница в результатах — она проиндексирована. Если нет — проверьте ниже.
2. Через Яндекс.Вебмастер
Раздел «Переобход страниц» → введите URL → проверьте статус.
3. Через Google Search Console
Раздел «Проверка URL» → введите URL → посмотрите статус индексации.
4. Через curl
# Проверить meta robots
curl -sL 'https://example.ru/page/' | grep -oP 'name="robots"\s+content="\K[^"]+'
# Проверить X-Robots-Tag
curl -sI 'https://example.ru/page/' | grep -i 'x-robots-tag'
# Проверить canonical
curl -sL 'https://example.ru/page/' | grep -oP 'rel="canonical"[^>]+href="\K[^"]+'
# Проверить HTTP-код
curl -sI 'https://example.ru/page/' | head -1
Частые причины отсутствия страницы в индексе
1. Noindex
Страница имеет <meta name="robots" content="noindex">. Это может быть намеренно (страницы пагинации) или ошибочно (важные страницы закрыты).
Решение: уберите noindex с важных страниц.
2. Disallow в robots.txt
Страница закрыта в robots.txt. Робот не посещает страницу и не может её проиндексировать.
Решение: уберите страницу из Disallow, если она важна.
3. Canonical на другую страницу
Страница имеет canonical, указывающий на другой URL. Поисковик считает её дублем.
Решение: проверьте, что canonical указывает на self-referencing URL.
4. Страница не посещена роботом
Если на страницу нет внутренних ссылок, робот может её не найти.
Решение: добавьте ссылки из навигации или контента. Или укажите в sitemap.
5. Страница слишком новая
Поисковику нужно время, чтобы найти и проиндексировать новую страницу. Обычно это занимает от нескольких часов до нескольких дней.
Решение: отправьте URL на переобход через Вебмастер/Search Console.
6. Страница с тонким контентом
Поисковики могут не индексировать страницы с очень коротким или дублирующимся контентом.
Решение: дополните контент или объедините с другой страницей.
Индексация и Health Score
В Health Score seoquest.ru индексация — один из ключевых параметров:
- robots, noindex, canonical — проверка закрытия от индексации
- Страницы в индексе — сравнение количества проиндексированных страниц с ожидаемым
- Индексация важных страниц — проверка, что коммерческие страницы проиндексированы
Чеклист индексации
- [ ] Страница не закрыта в robots.txt (Disallow)
- [ ] Нет meta robots noindex
- [ ] Нет X-Robots-Tag noindex
- [ ] Canonical указывает на self-referencing URL
- [ ] Страница отдаёт HTTP 200
- [ ] Страница есть в sitemap
- [ ] На страницу есть внутренние ссылки
- [ ] Страница проиндексирована (проверка через site:)
Итог
Индексация — фундамент SEO. Если страница не проиндексирована, она не может ранжироваться. Проверяйте robots.txt, meta robots, X-Robots-Tag и canonical на каждой важной странице. Используйте инструменты Яндекс.Вебмастера и Google Search Console для контроля индексации.
Проверить сайт по техническим и контентным пунктам можно в бесплатной проверке.
Когда уместен noindex
Мета noindex (или X-Robots-Tag) — страница может открываться людям, но не должна быть в поиске: служебный поиск, тонкая пагинация, личные кабинеты, черновики. Это не замена Disallow в robots.txt: при noindex робот обычно всё же загружает URL, при Disallow — может не ходить, но URL иногда «висит» в выдаче без сниппета.
Перенос страницы = чаще 301, а не noindex «на всякий случай».
Hreflang (если сайт мультиязычный)
Hreflang — как сказать поисковику, какой язык у страницы
Hreflang — это тег, который говорит поисковику: «Эта страница на русском, а эта — на английском».
Как работает
<link rel="alternate" hreflang="ru" href="https://example.ru/" />
<link rel="alternate" hreflang="en" href="https://example.com/" />
<link rel="alternate" hreflang="x-default" href="https://example.com/" />
Правила hreflang
- Каждая страница должна ссылаться на все языковые версии
- Каждая версия должна ссылаться на все остальные
- x-default — версия по умолчанию для пользователей без выбора языка
- Коды языков: ISO 639-1 (ru, en, de)
Частые ошибки
- Пропущенная обратная ссылка
- Hreflang на 404-странице
- Неправильные коды языков
Итог
Если у вас мультиязычный сайт — настройте hreflang. Если нет — эта статья не для вас.
Вопросы и ответы
Noindex и Disallow — в чём разница?
Noindex говорит роботу не индексировать страницу, но разрешает посещение. Disallow запрещает посещение. Для закрытия страниц от индексации используйте noindex, не Disallow.
Can canonical закрыть страницу от индексации?
Косвенно — да. Если canonical указывает на другую страницу, поисковик считает страницу дублем и индексирует только канонический URL. Но страница всё равно будет посещена роботом.
Как быстро страница попадёт в индекс?
Зависит от авторитетности сайта и частоты обхода. На авторитетных сайтах — от нескольких часов до дня. На новых — от нескольких дней до двух недель. Ускорить можно через Вебмастер/Search Console.
X-Robots-Tag работает для HTML-страниц?
Да, X-Robots-Tag работает для всех типов файлов, включая HTML. Но для HTML-страниц проще использовать meta robots в <head>.
Можно ли удалить страницу из индекса?
Да, добавьте noindex и отправьте URL на переобход. Поисковик удалит страницу из индекса в течение нескольких дней. Или настройте 301 редирект на другую страницу.