Индексация сайта: как проверить, ускорить и исправить ошибки

Як поліпшити індексацію

Страница может быть идеально написана, быстро загружаться и иметь удобную структуру — и при этом не приносить ни одного визита из поиска просто потому, что Google её не проиндексировал. Индексация — первый порог, который сайт должен пройти, и пока он не пройден, остальная работа не имеет значения.

Эта статья собрана из трёх наших отдельных материалов об индексации и полностью переписана: что это за процесс, как проверить свои страницы, почему они выпадают из индекса и что действительно ускоряет попадание в поиск.


1. Как работает индексация

Путь страницы в поиск состоит из трёх этапов, и провалиться можно на каждом.

  • Сканирование. Робот узнаёт об адресе — из карты сайта, из ссылки на другой странице или из своего предыдущего обхода — и загружает её содержимое;
  • Рендеринг. Google выполняет JavaScript и видит страницу примерно так, как её видит браузер. Если основной контент появляется только после выполнения скриптов, этот этап критичен;
  • Индексирование. Система анализирует содержимое и решает, добавлять ли страницу в индекс. Это решение, а не автоматическое действие: Google может просканировать страницу и не проиндексировать её.

Два вывода, которые стоит зафиксировать сразу.

Проиндексировано не означает «будет в топе». Индекс — это база, из которой формируется выдача. Попадание в базу ничего не обещает в отношении позиций.

Отсутствие в индексе не всегда ошибка. Служебные страницы, результаты внутреннего поиска, страницы фильтров и корзина в поиске не нужны. Цель — не «проиндексировать всё», а иметь в индексе именно те страницы, которые должны приводить людей.


2. Как проверить индексацию

Google Search Console — основной инструмент. В отчёте «Индексирование страниц» видно, сколько адресов в индексе, сколько вне его и по какой причине. Там же рядом список конкретных URL по каждому статусу — это и есть рабочий материал.

Проверка конкретного адреса. Инструмент проверки URL показывает, есть ли страница в индексе, когда её сканировали в последний раз, какой канонический адрес выбрал Google и как выглядит отрендеренный HTML. Именно здесь видно расхождение между тем, что вы написали в коде, и тем, что увидел робот.

Оператор site: Запрос site:вашсайт.com в поиске даёт приблизительное представление. Приблизительное — ключевое слово: цифра в этой выдаче не совпадает с данными Search Console и не должна совпадать. Оператор показывает выборку, а не полный индекс, и использовать его стоит только для быстрой проверки отдельной страницы, а не для подсчёта.

Если цифры Search Console и оператора расходятся, правильная — Search Console.


3. Почему страница не в индексе: читаем статусы

Search Console называет причину прямо. Проблема в том, что названия статусов не объясняют, что с ними делать.

Статус Что означает Что делать
Обнаружена, сейчас не проиндексирована Google знает адрес, но ещё не сканировал — отложил, чтобы не перегрузить сайт Проверить скорость ответа сервера и перелинковку. Много таких адресов — сигнал о краулинговом бюджете
Просканирована, сейчас не проиндексирована Страницу загрузили и решили не добавлять в индекс Чаще всего вопрос к ценности страницы, а не к технике. См. раздел 5
Страница с переадресацией Адрес отдаёт редирект Нормально, если редирект намеренный. Проверить по кодам ответа
Дубликат без канонической страницы, выбранной пользователем Google считает страницу дублем и выбрал каноническую сам Проставить канонический тег явно
Google выбрал иную каноническую страницу, чем пользователь Ваш canonical проигнорирован Страницы слишком похожи. Либо развести их по смыслу, либо согласиться с выбором Google
Заблокировано в файле robots.txt Робот не имеет доступа к странице Проверить правила. Часто блокировка осталась со времён разработки
Страница с тегом noindex Явный запрет индексирования Снять тег, если запрет ошибочный. О директивах — в материале о noindex и nofollow
Ложная ошибка 404 (soft 404) Страница фактически пустая, но отдаёт код 200 Добавить содержимое или отдавать честный 404
Ошибка сервера (5xx) Сервер не отдал страницу роботу Срочно: длительные 5xx замедляют сканирование всего сайта

 

Два статуса из этой таблицы путают чаще всего. «Обнаружена» — робот ещё не приходил. «Просканирована» — приходил, посмотрел и прошёл мимо. Это разные проблемы с разными решениями, и лечить первое способами для второго бесполезно.


4. Технические причины

Причина Как проверить
Закрытие от индексации, которое забыли снять после разработки Инструмент проверки URL покажет запрет за минуту. Самый распространённый случай из всех
Канонический тег ведёт на другую страницу В проверке URL — строка «каноническая страница». Шаблоны CMS иногда ставят canonical на главную
Цепочки редиректов Краулером: каждый лишний переход замедляет обход, длинную цепочку робот может не пройти
Страница недостижима из навигации Краулер не найдёт её обходом с главной. Здесь помогает продуманная структура сайта
Контент появляется только после JavaScript Сравнить исходный HTML и отрендеренный в проверке URL
Медленный сервер, частые 5xx Отчёт о статистике сканирования. Google сам снижает частоту обхода сайта, который плохо отвечает
Карта сайта с мусором Прогнать адреса из sitemap краулером: редиректы, 404 и закрытые страницы в ней снижают доверие

 

Техническую часть удобно проверять краулером — Screaming Frog, Netpeak Spider или Sitebulb. Как это делается пошагово, мы описали в статье о техническом аудите сайта.


5. Смысловые причины

Если технических препятствий нет, а статус — «Просканирована, сейчас не проиндексирована», дело в самой странице. Google посмотрел и решил, что в индексе она ничего не добавляет.

Типичные случаи:

  • Тонкие страницы. Карточка товара с двумя строками описания, страница услуги из трёх абзацев, новость из одного предложения;
  • Страницы под каждую комбинацию фильтров. Сотни адресов с одинаковым содержимым и разным порядком товаров;
  • Дубли. Один товар в нескольких категориях, версии с параметрами в адресе, печатные версии страниц;
  • Страницы пагинации без собственного смысла;
  • Страницы, конкурирующие между собой. Когда две ваши страницы закрывают один и тот же интент, Google может оставить в индексе одну — это каннибализация запросов;
  • Автоматически сгенерированный текст без пользы. Шаблонные описания, где меняется только название города или модели.

Решение здесь не техническое: либо странице нужен собственный смысл, либо её не должно быть в индексе вообще.


6. Что реально ускоряет индексацию

Способ Когда работает
Актуальная карта сайта в Search Console Всегда. Базовая гигиена: в sitemap только адреса, отдающие 200 и открытые для индексации
Запрос на индексирование через проверку URL Для отдельных важных страниц. Это просьба, а не команда, и массово так делать не получится
Внутренние ссылки с живых страниц Самый недооценённый способ. Страница, на которую ведёт ссылка из часто обновляемого раздела, сканируется быстрее
Обновление раздела, в котором лежит страница Робот возвращается туда, где содержимое меняется
Быстрый сервер Прямо влияет на то, сколько страниц робот успевает обойти за визит
Внешние ссылки Работают, но как побочный эффект — ради индексации их не покупают
Indexing API Не для обычных страниц. Google официально поддерживает его только для вакансий (JobPosting) и трансляций (BroadcastEvent). Советы применять его к статьям и карточкам товара противоречат документации

 

Последнюю строку стоит подчеркнуть: Indexing API регулярно советуют как универсальный ускоритель, хотя в документации Google прямо очерчены два типа контента, для которых он предназначен.


7. Краулинговый бюджет: кому о нём думать

Краулинговый бюджет — количество страниц, которое робот готов обойти на сайте за определённое время. Тема популярна в статьях, но к большинству сайтов отношения не имеет.

Google очерчивает круг прямо: гайд по краулинговому бюджету нужен крупным сайтам от миллиона страниц с содержимым, которое меняется хотя бы раз в неделю, и средним сайтам от 10 тысяч страниц с содержимым, которое меняется ежедневно. Отдельно упомянуты сайты с большим количеством адресов в статусе «Обнаружена, сейчас не проиндексирована».

Для остальных формулировка такая же прямая: если страницы сканируют в тот же день, когда их опубликовали, этот гайд читать не нужно — достаточно держать карту сайта актуальной и регулярно смотреть отчёт об индексировании.

Практически это означает, что корпоративному сайту на 200 страниц или магазину на 3000 позиций оптимизировать краулинговый бюджет незачем. Если у них что-то не индексируется, причина в разделах 4 и 5, а не в бюджете.


8. Коротко

  • Индексация — три этапа: сканирование, рендеринг, индексирование. Провалиться можно на каждом.
  • Google может просканировать страницу и не проиндексировать её. Это решение, а не сбой.
  • Проиндексировано не означает «в топе», а отсутствие в индексе не всегда ошибка.
  • Основной инструмент — отчёт «Индексирование страниц» в Search Console. Оператор site: даёт приблизительную выборку, и его цифра не должна совпадать с консолью.
  • «Обнаружена, сейчас не проиндексирована» — робот ещё не приходил. «Просканирована, сейчас не проиндексирована» — приходил и прошёл мимо. Разные проблемы.
  • Самые частые технические причины: забытое закрытие от индексации, canonical на другую страницу, недостижимость из навигации, медленный сервер.
  • Если техника в порядке, а страница не в индексе — вопрос к её ценности.
  • Indexing API официально работает только для вакансий и трансляций, не для статей и товаров.
  • Краулинговый бюджет — тема для сайтов от 10 тысяч страниц с ежедневными изменениями. Остальным не стоит о нём думать.

Проверить, что именно мешает страницам попадать в индекс, мы можем в рамках SEO-аудита, а исправить — в рамках внутренней оптимизации. Официальные пороги по краулинговому бюджету — в документации Google.

Обращайтесь!

Получите больше пользы

Вы получите от нас самый лучший контент, который поможет вашему бизнесу расти.
Ваш запрос отправлен

    Подписаться

    Продвигайтесь с нами – оставьте заявку прямо сейчас

    Получите бесплатную консультацию и оценку продвижения бизнеса
    Ваш запрос отправлен

      Отправить