Страница может быть идеально написана, быстро загружаться и иметь удобную структуру — и при этом не приносить ни одного визита из поиска просто потому, что Google её не проиндексировал. Индексация — первый порог, который сайт должен пройти, и пока он не пройден, остальная работа не имеет значения.
Эта статья собрана из трёх наших отдельных материалов об индексации и полностью переписана: что это за процесс, как проверить свои страницы, почему они выпадают из индекса и что действительно ускоряет попадание в поиск.
Путь страницы в поиск состоит из трёх этапов, и провалиться можно на каждом.
Два вывода, которые стоит зафиксировать сразу.
Проиндексировано не означает «будет в топе». Индекс — это база, из которой формируется выдача. Попадание в базу ничего не обещает в отношении позиций.
Отсутствие в индексе не всегда ошибка. Служебные страницы, результаты внутреннего поиска, страницы фильтров и корзина в поиске не нужны. Цель — не «проиндексировать всё», а иметь в индексе именно те страницы, которые должны приводить людей.
Google Search Console — основной инструмент. В отчёте «Индексирование страниц» видно, сколько адресов в индексе, сколько вне его и по какой причине. Там же рядом список конкретных URL по каждому статусу — это и есть рабочий материал.
Проверка конкретного адреса. Инструмент проверки URL показывает, есть ли страница в индексе, когда её сканировали в последний раз, какой канонический адрес выбрал Google и как выглядит отрендеренный HTML. Именно здесь видно расхождение между тем, что вы написали в коде, и тем, что увидел робот.
Оператор site: Запрос site:вашсайт.com в поиске даёт приблизительное представление. Приблизительное — ключевое слово: цифра в этой выдаче не совпадает с данными Search Console и не должна совпадать. Оператор показывает выборку, а не полный индекс, и использовать его стоит только для быстрой проверки отдельной страницы, а не для подсчёта.
Если цифры Search Console и оператора расходятся, правильная — Search Console.
Search Console называет причину прямо. Проблема в том, что названия статусов не объясняют, что с ними делать.
| Статус | Что означает | Что делать |
| Обнаружена, сейчас не проиндексирована | Google знает адрес, но ещё не сканировал — отложил, чтобы не перегрузить сайт | Проверить скорость ответа сервера и перелинковку. Много таких адресов — сигнал о краулинговом бюджете |
| Просканирована, сейчас не проиндексирована | Страницу загрузили и решили не добавлять в индекс | Чаще всего вопрос к ценности страницы, а не к технике. См. раздел 5 |
| Страница с переадресацией | Адрес отдаёт редирект | Нормально, если редирект намеренный. Проверить по кодам ответа |
| Дубликат без канонической страницы, выбранной пользователем | Google считает страницу дублем и выбрал каноническую сам | Проставить канонический тег явно |
| Google выбрал иную каноническую страницу, чем пользователь | Ваш canonical проигнорирован | Страницы слишком похожи. Либо развести их по смыслу, либо согласиться с выбором Google |
| Заблокировано в файле robots.txt | Робот не имеет доступа к странице | Проверить правила. Часто блокировка осталась со времён разработки |
| Страница с тегом noindex | Явный запрет индексирования | Снять тег, если запрет ошибочный. О директивах — в материале о noindex и nofollow |
| Ложная ошибка 404 (soft 404) | Страница фактически пустая, но отдаёт код 200 | Добавить содержимое или отдавать честный 404 |
| Ошибка сервера (5xx) | Сервер не отдал страницу роботу | Срочно: длительные 5xx замедляют сканирование всего сайта |
Два статуса из этой таблицы путают чаще всего. «Обнаружена» — робот ещё не приходил. «Просканирована» — приходил, посмотрел и прошёл мимо. Это разные проблемы с разными решениями, и лечить первое способами для второго бесполезно.
| Причина | Как проверить |
| Закрытие от индексации, которое забыли снять после разработки | Инструмент проверки URL покажет запрет за минуту. Самый распространённый случай из всех |
| Канонический тег ведёт на другую страницу | В проверке URL — строка «каноническая страница». Шаблоны CMS иногда ставят canonical на главную |
| Цепочки редиректов | Краулером: каждый лишний переход замедляет обход, длинную цепочку робот может не пройти |
| Страница недостижима из навигации | Краулер не найдёт её обходом с главной. Здесь помогает продуманная структура сайта |
| Контент появляется только после JavaScript | Сравнить исходный HTML и отрендеренный в проверке URL |
| Медленный сервер, частые 5xx | Отчёт о статистике сканирования. Google сам снижает частоту обхода сайта, который плохо отвечает |
| Карта сайта с мусором | Прогнать адреса из sitemap краулером: редиректы, 404 и закрытые страницы в ней снижают доверие |
Техническую часть удобно проверять краулером — Screaming Frog, Netpeak Spider или Sitebulb. Как это делается пошагово, мы описали в статье о техническом аудите сайта.
Если технических препятствий нет, а статус — «Просканирована, сейчас не проиндексирована», дело в самой странице. Google посмотрел и решил, что в индексе она ничего не добавляет.
Типичные случаи:
Решение здесь не техническое: либо странице нужен собственный смысл, либо её не должно быть в индексе вообще.
| Способ | Когда работает |
| Актуальная карта сайта в Search Console | Всегда. Базовая гигиена: в sitemap только адреса, отдающие 200 и открытые для индексации |
| Запрос на индексирование через проверку URL | Для отдельных важных страниц. Это просьба, а не команда, и массово так делать не получится |
| Внутренние ссылки с живых страниц | Самый недооценённый способ. Страница, на которую ведёт ссылка из часто обновляемого раздела, сканируется быстрее |
| Обновление раздела, в котором лежит страница | Робот возвращается туда, где содержимое меняется |
| Быстрый сервер | Прямо влияет на то, сколько страниц робот успевает обойти за визит |
| Внешние ссылки | Работают, но как побочный эффект — ради индексации их не покупают |
| Indexing API | Не для обычных страниц. Google официально поддерживает его только для вакансий (JobPosting) и трансляций (BroadcastEvent). Советы применять его к статьям и карточкам товара противоречат документации |
Последнюю строку стоит подчеркнуть: Indexing API регулярно советуют как универсальный ускоритель, хотя в документации Google прямо очерчены два типа контента, для которых он предназначен.
Краулинговый бюджет — количество страниц, которое робот готов обойти на сайте за определённое время. Тема популярна в статьях, но к большинству сайтов отношения не имеет.
Google очерчивает круг прямо: гайд по краулинговому бюджету нужен крупным сайтам от миллиона страниц с содержимым, которое меняется хотя бы раз в неделю, и средним сайтам от 10 тысяч страниц с содержимым, которое меняется ежедневно. Отдельно упомянуты сайты с большим количеством адресов в статусе «Обнаружена, сейчас не проиндексирована».
Для остальных формулировка такая же прямая: если страницы сканируют в тот же день, когда их опубликовали, этот гайд читать не нужно — достаточно держать карту сайта актуальной и регулярно смотреть отчёт об индексировании.
Практически это означает, что корпоративному сайту на 200 страниц или магазину на 3000 позиций оптимизировать краулинговый бюджет незачем. Если у них что-то не индексируется, причина в разделах 4 и 5, а не в бюджете.
Проверить, что именно мешает страницам попадать в индекс, мы можем в рамках SEO-аудита, а исправить — в рамках внутренней оптимизации. Официальные пороги по краулинговому бюджету — в документации Google.
Обращайтесь!