Страницы опубликованы, а в поиске их нет. Разбираем восемь причин по частоте встречаемости, как проверить каждую за минуту и почему сервисы проверки индексации показывают одно, а Вебмастер — другое.
- Норма — не меньше 80% опубликованных страниц в поиске. Ниже — проблема, а не особенность.
- Самая частая причина не запрет, а отсутствие ценности: страница есть, отвечать ей нечем.
- Вторая по частоте — страница-сирота: на неё не ведёт ни одна внутренняя ссылка.
- Защита от ботов может отдавать роботу заглушку — сайт выглядит доступным, но не индексируется.
- Массовая публикация тысяч страниц разом даёт массовые исключения «малополезная».
Как проверить, что страницы нет в индексе
Правильный способ
Инструмент проверки URL в Вебмастере: он показывает, знает ли поиск адрес, когда обходил и почему исключил. Это данные самого поиска, а не оценка со стороны.
Почему сервисы показывают другое
Сторонние сервисы проверяют индексацию парсингом выдачи и строят свою модель индекса. Расхождение в 20–30% между таким сервисом и Вебмастером — обычное дело. При конфликте прав Вебмастер.
Что смотреть массово
Раздел «Страницы в поиске» и сравнение с числом адресов в карте сайта. Если в карте 300, а в поиске 40 — работать надо с причинами исключения, а не с текстами.
Восемь причин по частоте
1. Страница ничего не добавляет
Формулировка в отчёте — «малополезная страница». Означает, что содержимое дублирует другие страницы или не отвечает ни на один запрос. Самая частая причина у сайтов с шаблонными страницами под города и услуги.
2. Страница-сирота
На неё не ведёт ни одна внутренняя ссылка, она есть только в карте сайта. Поиск такие страницы находит, но берёт неохотно: раз на неё не ссылается сам сайт, значит она не важна. Правило простое — минимум две входящие ссылки с уже проиндексированных страниц.
3. Дубль
Две страницы отвечают на один запрос. Поиск выбирает одну, вторую исключает. Классика: страница фильтра и страница раздела с одинаковым набором товаров, версии с параметрами в адресе, страницы пагинации.
4. Запрет в robots.txt или мета-теге
Самая обидная причина, потому что чинится за минуту. Проверяется в исходном коде страницы и в файле robots.txt. Часто остаётся с этапа разработки, когда сайт закрывали от индексации целиком.
5. Неверный канонический адрес
Страница указывает канонической другую страницу — и выпадает из индекса по собственному указанию. Встречается после переездов и в шаблонах, где canonical проставлен жёстко.
6. Ошибка ответа сервера
Страница отдаёт код, которого не должна: 404 вместо 200, 500 при нагрузке, редирект в цепочке. Проверяется ответом сервера, а не видом страницы в браузере.
7. Защита от ботов отдаёт заглушку
Файрвол или антибот отвечают роботу страницей-проверкой вместо содержимого. Для человека сайт работает, для поиска — пустая страница. Итог: адрес обойдён, но не проиндексирован, а иногда выбран неверный канонический. Проверять нужно ответ именно для поисковых user-agent.
8. Робот просто не дошёл
На редко обновляемом сайте обход идёт медленно, и новая страница ждёт очереди. Проверяется по статистике обхода: если робот берёт две страницы в сутки, сотня новых будет заходить месяцами.
Сколько ждать нормально
Сроки по ситуациям
Активно обновляемый сайт: от суток до недели. Редко обновляемый: две-четыре недели. Новый сайт: индексация быстрая, а вот ранжирование — отдельная история, разобранная на странице про песочницу.
Что ускоряет по-настоящему
Внутренние ссылки на новую страницу, регулярность публикаций и отправка на переобход. Причём первое важнее третьего: страница-сирота не спасается никакими пингами.
Массовый переобход в Google
Инструмента для массовой отправки у Google нет — Search Console принимает единичные адреса. Работают карта сайта с честными датами и внутренние ссылки. Протокол IndexNow Google не поддерживает, а Яндекс и Bing — да.
Что делать с массовой публикацией
Почему тысяча страниц разом — плохая идея
Молодой или средний сайт, опубликовавший тысячи страниц за неделю, получает массовые исключения с причиной «малополезная». Мы видели это на своём проекте: 18 000 адресов в карте против 11 в индексе.
Как правильно
Порциями, с внутренними ссылками между новыми страницами и со старых на новые. Каждая порция должна быть наполнена: пустая заготовка вредит сильнее, чем её отсутствие.
Как понять, что порция зашла
Через неделю после публикации сверьте список адресов с разделом «Страницы в поиске». Смотрите именно выборку URL, а не сводную цифру — она отстаёт.
Что делать по шагам, если страниц нет
Порядок, который экономит время: сначала дешёвые проверки, потом дорогие.
Шаг 1. Одна страница или все
Если не индексируется весь сайт — ищите общий запрет: robots.txt, noindex в шаблоне, ответ сервера, защиту от ботов. Если отдельные страницы — вопрос к ним самим.
Шаг 2. Спросить Вебмастер
Инструмент проверки URL называет причину прямым текстом. Это быстрее любых гипотез: поиск сам скажет, обходил ли он адрес и почему не взял.
Шаг 3. Посмотреть на страницу глазами робота
Ответ сервера, наличие текста в исходном коде без выполнения скриптов, мета-теги. Если содержимое появляется только после работы JS, поиск может его не увидеть.
Шаг 4. Проверить ссылки на неё
Ведут ли на страницу внутренние ссылки с уже проиндексированных разделов. Если нет — это и есть причина, и она чинится дешевле всего.
Частые вопросы
Вебмастеру: он показывает индекс Яндекса, сервис — свою модель, собранную парсингом выдачи. Расхождение в 20–30% нормально. Заодно убедитесь, что сравниваете сопоставимое: сводная цифра «страниц в поиске» отстаёт от факта, сверять надо со списком адресов.
От суток до трёх недель в зависимости от того, как часто робот вообще заходит на сайт. Переобход ускоряет визит, но не заставляет взять страницу в индекс: если она слабая или на неё нет ссылок, робот придёт быстрее и всё равно не возьмёт.
Страница 404 отдаёт код ошибки и в индекс не попадает сама. Политику закрывать не нужно: это документ, который поиск воспринимает как признак настоящего бизнеса. Закрывать имеет смысл служебные адреса, результаты фильтров и технические дубли.
Чаще всего защита от ботов отдаёт роботу страницу-проверку вместо содержимого. Проверьте ответ сервера для поискового user-agent, а не через браузер. Вторая причина — жёсткий noindex в шаблоне, оставшийся с разработки.
Скорее всего две вещи сразу: страницы шаблонные и не отвечают на разные запросы, и на них не ведут внутренние ссылки. Проверьте раздел исключённых: если там массово «малополезная» — вопрос к содержанию, а не к технике. Публиковать дальше в том же виде бессмысленно.
Никак напрямую: массового инструмента нет, Search Console принимает единичные адреса. Работают корректная карта сайта с честными датами изменения и внутренние ссылки на новые страницы. Телеграм-боты «для индексации» к официальным механизмам отношения не имеют.