Пока страница не попала в индекс, для поиска её не существует: ни позиций, ни трафика, ни заявок — сколько бы ни стоил контент. Ломается индексация сайта буднично: файл robots.txt закрывает от роботов половину каталога, sitemap.xml отдаёт давно удалённые адреса, дубли съедают краулинговый бюджет, а новые страницы неделями ждут обхода. Хуже всего, что снаружи это не видно — сайт открывается, выглядит нормально, и только проверка индексации показывает, что в Яндексе десятая часть страниц, а в Google — вообще другие адреса.
О разделе
В разделе собрана вся практика по теме: что такое индексация сайта и как поисковые роботы обходят страницы, как проверить индексацию сайта в Яндексе и Google четырьмя способами, как найти выпавшие и незаиндексированные страницы, как настроить robots.txt — какие директивы нужны, что закрывать от роботов и по каким правилам обрабатываются приоритеты, готовые примеры robots.txt для WordPress, 1С-Битрикс и интернет-магазина, как добавить sitemap.xml в Яндекс Вебмастер и Google Search Console и как ускорить попадание страниц в поиск через переобход.
Отдельно разбираем ошибки, из-за которых сайт выпадает из поиска, и чек-лист проверки robots.txt перед запуском — он спасает трафик чаще, чем принято думать. Это тот случай, когда час технической работы даёт больше, чем месяц написания текстов: на аудитах мы регулярно видим, как причиной «SEO не работает» оказывается одна строчка Disallow, добавленная ещё при разработке.
Указывает основную версию страницы при дублях с параметрами. Канониклы должны быть абсолютными и вести на код 200.
# проверить, что отдаётся один канонический адрес
curl -s https://example.ru/uslugi/seo/ | grep -i canonical