Індексація сайту: як перевірити, прискорити і виправити помилки

Як поліпшити індексацію

Сторінка може бути ідеально написана, швидко вантажитися й мати зручну структуру — і при цьому не приносити жодного візиту з пошуку просто тому, що Google її не проіндексував. Індексація — перший поріг, який сайт має пройти, і поки він не пройдений, решта роботи не має значення.

Ця стаття зібрана з трьох наших окремих матеріалів про індексацію й повністю переписана: що це за процес, як перевірити свої сторінки, чому вони випадають з індексу і що справді прискорює потрапляння в пошук.


1. Як працює індексація

Шлях сторінки в пошук складається з трьох етапів, і провалитися можна на кожному.

  • Сканування. Робот дізнається про адресу — із карти сайту, з посилання на іншій сторінці або зі свого попереднього обходу — і завантажує її вміст;
  • Рендеринг. Google виконує JavaScript і бачить сторінку приблизно так, як її бачить браузер. Якщо основний контент з’являється лише після виконання скриптів, цей етап критичний;
  • Індексування. Система аналізує вміст і вирішує, чи додавати сторінку до індексу. Це рішення, а не автоматична дія: Google може просканувати сторінку й не проіндексувати її.

Два висновки, які варто зафіксувати одразу.

Проіндексовано не означає «буде в топі». Індекс — це база, з якої формується видача. Потрапляння в базу нічого не обіцяє щодо позицій.

Відсутність в індексі не завжди помилка. Службові сторінки, результати внутрішнього пошуку, сторінки фільтрів і кошик у пошуку не потрібні. Мета — не «проіндексувати все», а мати в індексі саме ті сторінки, які мають приводити людей.


2. Як перевірити індексацію

Google Search Console — основний інструмент. У звіті «Індексування сторінок» видно, скільки адрес у індексі, скільки поза ним і з якої причини. Там же поруч список конкретних URL за кожним статусом — це і є робочий матеріал.

Перевірка конкретної адреси. Інструмент перевірки URL показує, чи є сторінка в індексі, коли її сканували востаннє, яку канонічну адресу вибрав Google і як виглядає відрендерений HTML. Саме тут видно розбіжність між тим, що ви написали в коді, і тим, що побачив робот.

Оператор site: Запит site:вашсайт.com у пошуку дає приблизне уявлення. Приблизне — ключове слово: цифра в цьому звіті не збігається з даними Search Console і не має збігатися. Оператор показує вибірку, а не повний індекс, і використовувати його варто лише для швидкої перевірки окремої сторінки, а не для підрахунку.

Якщо цифри Search Console й оператора розходяться, правильна — Search Console.


3. Чому сторінка не в індексі: читаємо статуси

Search Console називає причину прямо. Проблема в тому, що назви статусів не пояснюють, що з ними робити.

Статус Що означає Що робити
Виявлена, наразі не проіндексована Google знає адресу, але ще не сканував — відклав, щоб не перевантажити сайт Перевірити швидкість відповіді сервера й перелінковку. Багато таких адрес — сигнал про краулінговий бюджет
Просканована, наразі не проіндексована Сторінку завантажили й вирішили не додавати до індексу Найчастіше питання до цінності сторінки, а не до техніки. Див. розділ 5
Сторінка з переадресацією Адреса віддає редирект Нормально, якщо редирект навмисний. Перевірити за кодами відповіді
Дублікат без канонічної сторінки, вибраної користувачем Google вважає сторінку дублем і вибрав канонічну сам Проставити канонічний тег явно
Google вибрав іншу канонічну сторінку, ніж користувач Ваш canonical проігноровано Сторінки надто схожі. Або розвести їх за змістом, або погодитися з вибором Google
Заблоковано у файлі robots.txt Робот не має доступу до сторінки Перевірити правила. Часто блокування лишилося з часів розробки
Сторінка з тегом noindex Явна заборона індексування Зняти тег, якщо заборона помилкова. Про директиви — в матеріалі про noindex і nofollow
Хибна помилка 404 (soft 404) Сторінка фактично порожня, але віддає код 200 Додати вміст або віддавати чесний 404
Помилка сервера (5xx) Сервер не віддав сторінку роботу Терміново: тривалі 5xx уповільнюють сканування всього сайту

 

Два статуси з цієї таблиці плутають найчастіше. «Виявлена» — робот ще не приходив. «Просканована» — приходив, подивився й пройшов повз. Це різні проблеми з різними рішеннями, і лікувати перше способами для другого марно.


4. Технічні причини

Причина Як перевірити
Закриття від індексації, яке забули зняти після розробки Інструмент перевірки URL покаже заборону за хвилину. Найпоширеніший випадок із усіх
Канонічний тег веде на іншу сторінку У перевірці URL — рядок «канонічна сторінка». Шаблони CMS іноді ставлять canonical на головну
Ланцюжки редиректів Краулером: кожен зайвий перехід уповільнює обхід, довгий ланцюжок робот може не пройти
Сторінка недосяжна з навігації Краулер не знайде її обходом із головної. Тут допомагає продумана структура сайту
Контент з’являється лише після JavaScript Порівняти початковий HTML і відрендерений у перевірці URL
Повільний сервер, часті 5xx Звіт про статистику сканування. Google сам знижує частоту обходу сайту, який погано відповідає
Карта сайту з мотлохом Прогнати адреси з sitemap краулером: редиректи, 404 і закриті сторінки в ній знижують довіру

 

Технічну частину зручно перевіряти краулером — Screaming Frog, Netpeak Spider або Sitebulb. Як це робиться покроково, ми описали в статті про технічний аудит сайту.


5. Змістові причини

Якщо технічних перешкод немає, а статус — «Просканована, наразі не проіндексована», справа в самій сторінці. Google подивився й вирішив, що в індексі вона нічого не додає.

Типові випадки:

  • Тонкі сторінки. Картка товару з двома рядками опису, сторінка послуги з трьох абзаців, новина з одного речення;
  • Сторінки під кожну комбінацію фільтрів. Сотні адрес із однаковим вмістом і різним порядком товарів;
  • Дублі. Один товар у кількох категоріях, версії з параметрами в адресі, друковані версії сторінок;
  • Сторінки пагінації без власного сенсу;
  • Сторінки, що конкурують між собою. Коли дві ваші сторінки закривають той самий намір, Google може лишити в індексі одну — це канібалізація запитів;
  • Автоматично згенерований текст без користі. Шаблонні описи, де змінюється лише назва міста чи моделі.

Рішення тут не технічне: або сторінці потрібен власний сенс, або її не має бути в індексі взагалі.


6. Що реально прискорює індексацію

Спосіб Коли працює
Актуальна карта сайту в Search Console Завжди. Базова гігієна: у sitemap лише адреси, що віддають 200 і відкриті для індексації
Запит на індексування через перевірку URL Для окремих важливих сторінок. Це прохання, а не команда, і масово так робити не вийде
Внутрішні посилання з живих сторінок Найнедооціненіший спосіб. Сторінка, на яку веде посилання з розділу, що часто оновлюється, сканується швидше
Оновлення розділу, у якому лежить сторінка Робот повертається туди, де вміст змінюється
Швидкий сервер Прямо впливає на те, скільки сторінок робот встигає обійти за візит
Зовнішні посилання Працюють, але як побічний ефект — заради індексації їх не купують
Indexing API Не для звичайних сторінок. Google офіційно підтримує його лише для вакансій (JobPosting) і трансляцій (BroadcastEvent). Поради застосовувати його до статей і карток товару суперечать документації

 

Останній рядок варто підкреслити: Indexing API регулярно радять як універсальний прискорювач, хоча в документації Google прямо окреслено два типи контенту, для яких він призначений.


7. Краулінговий бюджет: кому про нього думати

Краулінговий бюджет — кількість сторінок, яку робот готовий обійти на сайті за певний час. Тема популярна в статтях, але до більшості сайтів стосунку не має.

Google окреслює коло прямо: гайд по краулінговому бюджету потрібен великим сайтам від мільйона сторінок із вмістом, що змінюється хоча б раз на тиждень, і середнім сайтам від 10 тисяч сторінок із вмістом, що змінюється щодня. Окремо згадані сайти з великою кількістю адрес у статусі «Виявлена, наразі не проіндексована».

Для решти формулювання таке ж пряме: якщо сторінки сканують того ж дня, коли їх опублікували, цей гайд читати не потрібно — достатньо тримати карту сайту актуальною й регулярно дивитися звіт про індексування.

Практично це означає, що корпоративному сайту на 200 сторінок або магазину на 3000 позицій оптимізувати краулінговий бюджет нема чого. Якщо в них щось не індексується, причина в розділах 4 і 5, а не в бюджеті.


8. Коротко

  • Індексація — три етапи: сканування, рендеринг, індексування. Провалитися можна на кожному.
  • Google може просканувати сторінку й не проіндексувати її. Це рішення, а не збій.
  • Проіндексовано не означає «у топі», а відсутність в індексі не завжди помилка.
  • Основний інструмент — звіт «Індексування сторінок» у Search Console. Оператор site: дає приблизну вибірку, і його цифра не має збігатися з консоллю.
  • «Виявлена, наразі не проіндексована» — робот ще не приходив. «Просканована, наразі не проіндексована» — приходив і пройшов повз. Різні проблеми.
  • Найчастіші технічні причини: забуте закриття від індексації, canonical на іншу сторінку, недосяжність із навігації, повільний сервер.
  • Якщо техніка в порядку, а сторінка не в індексі — питання до її цінності.
  • Indexing API офіційно працює лише для вакансій і трансляцій, не для статей і товарів.
  • Краулінговий бюджет — тема для сайтів від 10 тисяч сторінок із щоденними змінами. Решті не варто про нього думати.

Перевірити, що саме заважає сторінкам потрапляти в індекс, ми можемо в межах SEO-аудиту, а виправити — у межах внутрішньої оптимізації. Офіційні пороги щодо краулінгового бюджету — у документації Google.

Звертайтесь!

Отримайте більше користі

Ви отримаєте від нас найкращий контент, який допоможе вашому бізнесу зростати.
Ваш запит надіслано

    Підписатись

    Просувайтеся з нами — залиште заявку просто зараз

    Отримайте безкоштовну консультацію та оцінку просування бізнесу
    Ваш запит надіслано

      Надіслати