Коротко. Чтобы найти выпавшие и незаиндексированные страницы, сравнивают три числа: сколько страниц реально на сайте, сколько отправлено в sitemap.xml и сколько показывает отчёт «Страницы» в Google Search Console или «Страницы в поиске» в Яндекс.Вебмастере. Разница между первым и третьим числом — это и есть пропавшие страницы, а рядом в панели указана точная причина исключения по каждой из них. Проверку стоит делать раз в 2-4 недели для сайта до 500 страниц и раз в неделю для каталога с частым обновлением товаров — резкое падение индекса на 15-20% за короткий срок почти всегда сигнализирует о технической поломке, а не о естественных колебаниях.
Два разных вопроса: «не попала» и «вылетела»
Страница, которая никогда не была в индексе, и страница, которая была там, а потом пропала, — это две разные проблемы с разными причинами и разной степенью срочности. Никогда не индексированная страница часто просто новая или слабо связана ссылками с остальным сайтом — неприятно, но не критично, процесс идёт своим чередом. А вот страница, которая приносила трафик месяцами и вдруг выпала из индекса, — это почти всегда сигнал о поломке: изменился код, слетел редирект, кто-то по ошибке поставил noindex при обновлении шаблона. Разница на практике в срочности реакции: пропажу уже работавшей страницы нужно чинить в течение дней, а не ждать месяц, пока «само разберётся» — трафик с неё в это время равен нулю.
Как выглядит сравнение чисел на практике
Возьмите три источника. Первый — реальное число страниц на сайте: страницы каталога, статьи, посадочные. Второй — число URL в sitemap.xml, который сайт сам отправляет поисковику как список «вот что у меня есть, обходи это». Третий — число страниц, которое Google Search Console или Яндекс.Вебмастер показывают как фактически проиндексированные. Если первое и второе число сильно расходятся — не все страницы вообще попали в sitemap, это техническая недоработка на стороне сайта, робот о части страниц может даже не знать. Если второе и третье расходятся — sitemap отправлен верно, но часть из отправленного поисковик не взял в индекс, и вот здесь начинается диагностика по причинам.
Где искать список исключённых страниц с причиной
В Google Search Console нужен раздел «Индексирование» → «Страницы» — там прямо на графике видны две линии: «Проиндексировано» и «Не проиндексировано», а под графиком — таблица с группировкой по причине: «Обнаружено, но пока не проиндексировано», «Страница с переадресацией», «Дубликат, канонический URL не выбран пользователем», «Заблокировано robots.txt» и другие. Клик по любой причине раскрывает конкретный список URL. В Яндекс.Вебмастере аналог — «Индексирование» → «Страницы в поиске», где отдельная вкладка «Исключённые» показывает то же самое: список адресов с пометкой, почему страница не в поиске. Разница между панелями в детализации формулировок, но логика одна — сначала смотрите на группы причин, а не на отдельные URL, потому что чаще всего десятки страниц выпадают по одной и той же системной причине.
Группы причин, которые встречаются чаще всего
- Дубли без единого канонического URL. Несколько адресов с одинаковым или почти одинаковым контентом — например, страница товара доступна и с параметрами фильтра, и без них. Поисковик сам выбирает одну версию, остальные помечает как дубли.
- Обнаружено, но не проиндексировано. Робот знает про страницу, но пока не счёл нужным добавить в базу — обычно из-за низкой значимости контента или того, что краулинговый бюджет уходит на другие разделы сайта.
- Заблокировано через robots.txt или noindex. Технический запрет, который либо стоит осознанно, либо остался случайно после разработки.
- Ошибка сервера или редирект. Страница при обходе роботом вернула код 4xx/5xx или ведёт через цепочку редиректов — робот индексирует конечную точку, а не исходный адрес.
Как отличить массовую поломку от единичного случая
Если из индекса выпало 3-5 страниц — вероятно, единичные случаи: неудачный редирект, забытый noindex на конкретной странице. Если выпало резко 15% и больше от общего числа — ищите системную причину, которая касается шаблона или целого раздела, а не отдельной страницы. Типичный сценарий — обновление CMS или смена темы, после которого noindex-тег, который стоял в коде одной тестовой страницы, попал в общий шаблон и разошёлся по всему разделу каталога. Проверяется это быстро: откройте исходный код нескольких выпавших страниц (Ctrl+U) и поищите тег meta name="robots" — если он есть с содержимым noindex сразу на нескольких разных страницах одного раздела, причина найдена за пять минут, а не за неделю догадок.
Проверка через краулер, когда панели вебмастера недостаточно
Отчёты Google Search Console и Яндекс.Вебмастера показывают историю по URL, которые поисковик уже когда-то видел. Если страница вообще никогда не сканировалась — она может не появиться ни в одном отчёте об исключениях, просто отсутствовать. Чтобы найти именно такие «слепые зоны», нужен сторонний обход сайта краулером (например, Screaming Frog): он строит полный список реальных URL сайта независимо от того, что знает поисковик, и это список затем сверяется с данными панели. Расхождение — это страницы, до которых робот пока физически не добрался: обычно из-за отсутствия внутренних ссылок на них или слишком глубокой вложенности в структуре сайта.
| Инструмент | Что показывает | Когда использовать |
|---|---|---|
| Google Search Console / Яндекс.Вебмастер | Историю по URL, которые поисковик уже видел, с причиной исключения | Регулярный мониторинг, диагностика конкретной группы страниц |
| Краулер (Screaming Frog и аналоги) | Полный список реальных URL сайта независимо от данных поисковика | Поиск страниц, до которых робот вообще не дошёл |
| Сравнение sitemap.xml и факта | Не пропущены ли страницы при формировании самого sitemap | Первый шаг проверки, до похода в панели |
Что делать после того, как список выпавших страниц собран
Порядок такой: сначала группируете найденные URL по причине исключения, потому что решение для каждой группы своё. Технические причины — noindex, блокировка в robots.txt, ошибки сервера — чинятся разработчиком за часы, без изменения контента. Причина «низкая значимость контента» требует содержательной работы: расширить текст, добавить уникальности, убрать признаки дубля. После исправления не ждите пассивно — отправьте страницы на переобход через инструмент «Проверка URL» в Search Console или «Переобход страниц» в Яндекс.Вебмастере, это ускоряет повторную проверку до 1-3 дней вместо ожидания планового визита робота. Более широкий разбор технических причин, которые тормозят индексацию сайта в целом, разобран в материале про SEO-аудит.
Как часто нужно проверять индексацию, чтобы не пропустить проблему
Разумная периодичность зависит от размера и динамики сайта. Для сайта-визитки или блога до 100-200 страниц, который редко меняется, достаточно проверки раз в месяц — резкие проблемы там редкость. Для интернет-магазина с активным обновлением каталога, где еженедельно добавляются и удаляются товары, стоит смотреть отчёт раз в 1-2 недели: там выше риск, что технические изменения (например, массовое обновление карточек через выгрузку из 1С) случайно затронут индексацию сразу многих страниц. Отдельно стоит проверять индексацию сразу после любого крупного технического изменения сайта — смены темы, миграции на новый движок, редизайна — потому что именно такие события чаще всего и вызывают массовые выпадения, а не постепенное естественное колебание индекса. Если такие изменения случаются регулярно, разумнее не проверять индексацию вручную от случая к случаю, а вынести её в постоянный мониторинг вместе с остальными показателями веб-аналитики.
FAQ
Сколько страниц из общего числа сайта нормально не иметь в индексе?
Зависит от типа сайта. Для небольшого сайта-визитки нормой считается 90-100% индексации. Для каталога с тысячами товаров нормальны и 60-80%, потому что часть URL — это технические дубли фильтров, которые поисковик сознательно не берёт в базу.
Как быстро можно узнать причину, почему конкретная страница выпала?
Через «Проверку URL» в Google Search Console — статус и причина показываются за секунды по точному адресу. В Яндекс.Вебмастере аналогичная информация — в разделе «Страницы в поиске» → «Исключённые».
Может ли страница пропасть из индекса без каких-либо изменений на сайте?
Технически да, но редко и обычно есть внешняя причина: смена алгоритма ранжирования, проблема с доступностью сервера в момент визита робота, или на сайт-агрегатор появился более авторитетный источник с тем же контентом. В большинстве случаев причина всё же на стороне сайта.
Нужно ли проверять индексацию сразу после запуска нового сайта?
Да, в первые 2-4 недели стоит смотреть отчёты чаще обычного — раз в несколько дней. На новом домене чаще случаются технические огрехи, оставшиеся после разработки: забытый noindex, закрытые в robots.txt разделы.
Что делать, если страниц выпало сразу несколько сотен?
Сначала группировать по причине исключения — почти всегда за массовым выпадением стоит одна системная проблема (шаблон, редирект, ошибка сервера), а не сотни независимых случаев. Найдя и исправив причину, отправлять раздел на переобход сразу пакетом через свежий sitemap.
Найти все выпавшие страницы сайта за один отчёт
Бесплатный аудит сравнит полный список страниц сайта с фактическим индексом и покажет причину по каждой исключённой странице.
Канонический адрес
Указывает основную версию страницы при дублях с параметрами. Канониклы должны быть абсолютными и вести на код 200.
# проверить, что отдаётся один канонический адрес
curl -s https://example.ru/uslugi/seo/ | grep -i canonical