Главная / База знаний / Индексация и краулинг

Как проверить robots.txt: валидаторы Яндекса и Google и типовые ошибки

6 мин чтения обновлено 14 августа 2026 Индексация и краулинг

Коротко. Проверить robots.txt нужно в двух валидаторах: в Яндекс.Вебмастере это «Инструменты» → «Анализ robots.txt», где можно подставить список URL и увидеть, разрешён ли каждый; в Google Search Console — отчёт robots.txt в настройках ресурса плюс «Проверка URL» для конкретного адреса. Перед этим убедитесь, что файл лежит в корне домена, отдаёт код 200 и открывается по адресу вида example.com/robots.txt. Проверка занимает 10-15 минут и обязательна после каждого релиза: одна лишняя строка Disallow способна убрать из поиска весь сайт за две недели.

С чего начинается проверка: сам файл

Половина проблем обнаруживается до всяких валидаторов. Откройте в браузере https://вашдомен/robots.txt и проверьте четыре вещи.

Полезная привычка — проверять файл не только браузером, но и запросом с сервера: браузер может отдать закешированную версию, а робот получит другую.

Валидатор Яндекса: «Анализ robots.txt»

Инструмент находится в Яндекс.Вебмастере, раздел «Инструменты» → «Анализ robots.txt». Он делает две вещи одновременно.

  1. Загружает актуальный файл с сайта и показывает результаты разбора построчно: какие директивы приняты, какие содержат ошибки, какие проигнорированы как неизвестные.
  2. Проверяет список адресов. В поле «Разрешены ли URL?» вставьте 10-30 важных страниц — главную, категории, карточки, страницы услуг, статьи — и получите по каждой ответ «разрешён» или «запрещён строкой номер N». Это единственный способ проверить robots.txt объективно: правило, из-за которого закрыта страница, будет названо явно.

Отдельная ценность инструмента в том, что файл можно править прямо в поле и проверять гипотезы, не выкладывая изменения на сайт. Итоговый вариант потом переносится на сервер. Проверить конкретный адрес постфактум можно ещё и через «Проверку статуса URL» — там видно, попал ли запрет в реальный обход.

Проверка на стороне Google

Отдельный тестер robots.txt в Google закрыт: сейчас его роль делят два инструмента.

Отчёт robots.txt. Находится в настройках ресурса Search Console. Показывает, какие файлы robots.txt Google нашёл на ваших хостах, когда скачивал каждый в последний раз, какой получил код ответа и сколько ошибок нашёл при разборе. Здесь же видны предыдущие версии файла — незаменимо, когда нужно понять, что именно уехало на прод в день падения трафика.

Проверка URL. Вставьте адрес в строку поиска сверху. Если страница закрыта, статус будет «Заблокирована в файле robots.txt». Кнопка «Проверить страницу на сайте» дополнительно покажет заблокированные ресурсы — скрипты и стили, без которых Google не сможет корректно отрендерить страницу.

Важное отличие систем: директива Clean-param работает только у Яндекса, Crawl-delay не поддерживается ни Google, ни Яндексом (скорость обхода настраивается в Вебмастере), а Host не используется с 2018 года. Google при конфликте правил выбирает наиболее длинное совпадение пути, и при равной длине приоритет у Allow.

Типовые ошибки, которые находит проверка

Ошибка Последствие Как выглядит
Тотальный запрет с тестового сервера Сайт полностью выпадает из поиска User-agent: * / Disallow: /
Закрыт весь раздел вместо одной страницы Уходит из индекса весь каталог Disallow: /catalog вместо /catalog/search
Закрыты CSS и JS Страница рендерится неверно, качество оценивается ниже Disallow: /wp-content/ целиком
Относительный адрес карты сайта Директива игнорируется Sitemap: /sitemap.xml
Пустая строка внутри блока User-agent Часть правил не относится ни к кому Разрыв между Disallow-строками
Несовпадение регистра пути Правило не срабатывает Disallow: /Catalog/ при реальном /catalog/
Попытка убрать страницу из индекса запретом Страница остаётся в выдаче без описания Disallow вместо мета-тега noindex
Директива Noindex внутри robots.txt Не поддерживается, строка игнорируется Noindex: /page/

Последние две строки заслуживают отдельного объяснения, потому что ошибка встречается почти в каждом втором аудите. Запрет в robots.txt закрывает обход, а не индексирование. Робот не скачает страницу, но при наличии ссылок на неё способен показать адрес в выдаче — без заголовка и описания. Чтобы страница действительно ушла из индекса, обход должен быть разрешён, а на самой странице стоять <meta name="robots" content="noindex"> или заголовок X-Robots-Tag. Механику мы подробно разбираем в других материалах раздела об индексации.

Чек-лист проверки перед релизом

  1. Файл открывается по адресу в корне и отдаёт 200.
  2. В нём нет строки Disallow: / для User-agent: *.
  3. Прогнаны через валидатор Яндекса минимум 20 приоритетных URL — все разрешены.
  4. Проверены 5-10 адресов, которые должны быть закрыты: корзина, личный кабинет, внутренний поиск, страницы сортировки. Все запрещены.
  5. Скрипты и стили открыты для обхода.
  6. Директива Sitemap указана абсолютным адресом и отдаёт 200.
  7. Проверены robots.txt всех поддоменов, включая тестовые: тестовый контур должен быть закрыт, боевой — открыт.
  8. Версия файла зафиксирована в системе контроля версий, чтобы можно было сравнить её с предыдущей при разборе инцидента.

Проверка занимает четверть часа, а её отсутствие стоит месяцев восстановления трафика. Поэтому в проектах на поддержке от 10 000 ₽ в месяц robots.txt входит в обязательный послерелизный контроль, а на этапе разработки сайта боевой файл готовится заранее и подменяет тестовый в момент выкладки — не позже.

Как проверить robots.txt, если сайт ещё не открыт для поиска?

Валидатор Яндекса умеет работать с текстом файла, вставленным вручную, — сайт для этого не нужен. Так проверяют боевую версию заранее, до переноса на прод. Права на домен всё равно понадобятся, чтобы после запуска увидеть реальную картину обхода.

Через сколько поисковик увидит изменения в robots.txt?

Файл перечитывается примерно раз в сутки. Снятие запрета не означает мгновенного возврата страниц: их ещё нужно обойти и переиндексировать, на это уходит от нескольких дней до 3-4 недель. Ускорить помогает отправка адресов на переобход.

Что важнее при конфликте — Allow или Disallow?

Побеждает более конкретное правило, то есть с более длинным совпадением пути. При одинаковой длине приоритет отдаётся Allow. Проверять такие пересечения на глаз бессмысленно, для этого и существует валидатор со списком URL.

Нужен ли robots.txt вообще, если закрывать нечего?

Да. Даже минимальный файл с открытым доступом и директивой Sitemap полезен: он избавляет от лишних 404 в логах и подсказывает поисковику адрес карты сайта. Отсутствие файла — не катастрофа, но и не аккуратное решение.

Можно ли одним robots.txt закрыть сайт от парсеров и нейросетей?

Частично. Добросовестные краулеры директивы соблюдают, и для ботов ИИ-сервисов правила можно прописать отдельными блоками User-agent. Парсеры, которые игнорируют файл, останавливают только на уровне сервера. Обратная задача — быть видимым для ИИ-поиска — решается в рамках GEO/AI-оптимизации.

Проверим robots.txt и всю техническую базу индексации

Прогоним файл через валидаторы, найдём закрытые по ошибке разделы и покажем, что вернётся в поиск после правок.

ПОЛУЧИТЬ БЕСПЛАТНЫЙ АУДИТ →

Читайте дальше