Сторінка може бути ідеально написана, швидко вантажитися й мати зручну структуру — і при цьому не приносити жодного візиту з пошуку просто тому, що Google її не проіндексував. Індексація — перший поріг, який сайт має пройти, і поки він не пройдений, решта роботи не має значення.
Ця стаття зібрана з трьох наших окремих матеріалів про індексацію й повністю переписана: що це за процес, як перевірити свої сторінки, чому вони випадають з індексу і що справді прискорює потрапляння в пошук.
Шлях сторінки в пошук складається з трьох етапів, і провалитися можна на кожному.
Два висновки, які варто зафіксувати одразу.
Проіндексовано не означає «буде в топі». Індекс — це база, з якої формується видача. Потрапляння в базу нічого не обіцяє щодо позицій.
Відсутність в індексі не завжди помилка. Службові сторінки, результати внутрішнього пошуку, сторінки фільтрів і кошик у пошуку не потрібні. Мета — не «проіндексувати все», а мати в індексі саме ті сторінки, які мають приводити людей.
Google Search Console — основний інструмент. У звіті «Індексування сторінок» видно, скільки адрес у індексі, скільки поза ним і з якої причини. Там же поруч список конкретних URL за кожним статусом — це і є робочий матеріал.
Перевірка конкретної адреси. Інструмент перевірки URL показує, чи є сторінка в індексі, коли її сканували востаннє, яку канонічну адресу вибрав Google і як виглядає відрендерений HTML. Саме тут видно розбіжність між тим, що ви написали в коді, і тим, що побачив робот.
Оператор site: Запит site:вашсайт.com у пошуку дає приблизне уявлення. Приблизне — ключове слово: цифра в цьому звіті не збігається з даними Search Console і не має збігатися. Оператор показує вибірку, а не повний індекс, і використовувати його варто лише для швидкої перевірки окремої сторінки, а не для підрахунку.
Якщо цифри Search Console й оператора розходяться, правильна — Search Console.
Search Console називає причину прямо. Проблема в тому, що назви статусів не пояснюють, що з ними робити.
| Статус | Що означає | Що робити |
| Виявлена, наразі не проіндексована | Google знає адресу, але ще не сканував — відклав, щоб не перевантажити сайт | Перевірити швидкість відповіді сервера й перелінковку. Багато таких адрес — сигнал про краулінговий бюджет |
| Просканована, наразі не проіндексована | Сторінку завантажили й вирішили не додавати до індексу | Найчастіше питання до цінності сторінки, а не до техніки. Див. розділ 5 |
| Сторінка з переадресацією | Адреса віддає редирект | Нормально, якщо редирект навмисний. Перевірити за кодами відповіді |
| Дублікат без канонічної сторінки, вибраної користувачем | Google вважає сторінку дублем і вибрав канонічну сам | Проставити канонічний тег явно |
| Google вибрав іншу канонічну сторінку, ніж користувач | Ваш canonical проігноровано | Сторінки надто схожі. Або розвести їх за змістом, або погодитися з вибором Google |
| Заблоковано у файлі robots.txt | Робот не має доступу до сторінки | Перевірити правила. Часто блокування лишилося з часів розробки |
| Сторінка з тегом noindex | Явна заборона індексування | Зняти тег, якщо заборона помилкова. Про директиви — в матеріалі про noindex і nofollow |
| Хибна помилка 404 (soft 404) | Сторінка фактично порожня, але віддає код 200 | Додати вміст або віддавати чесний 404 |
| Помилка сервера (5xx) | Сервер не віддав сторінку роботу | Терміново: тривалі 5xx уповільнюють сканування всього сайту |
Два статуси з цієї таблиці плутають найчастіше. «Виявлена» — робот ще не приходив. «Просканована» — приходив, подивився й пройшов повз. Це різні проблеми з різними рішеннями, і лікувати перше способами для другого марно.
| Причина | Як перевірити |
| Закриття від індексації, яке забули зняти після розробки | Інструмент перевірки URL покаже заборону за хвилину. Найпоширеніший випадок із усіх |
| Канонічний тег веде на іншу сторінку | У перевірці URL — рядок «канонічна сторінка». Шаблони CMS іноді ставлять canonical на головну |
| Ланцюжки редиректів | Краулером: кожен зайвий перехід уповільнює обхід, довгий ланцюжок робот може не пройти |
| Сторінка недосяжна з навігації | Краулер не знайде її обходом із головної. Тут допомагає продумана структура сайту |
| Контент з’являється лише після JavaScript | Порівняти початковий HTML і відрендерений у перевірці URL |
| Повільний сервер, часті 5xx | Звіт про статистику сканування. Google сам знижує частоту обходу сайту, який погано відповідає |
| Карта сайту з мотлохом | Прогнати адреси з sitemap краулером: редиректи, 404 і закриті сторінки в ній знижують довіру |
Технічну частину зручно перевіряти краулером — Screaming Frog, Netpeak Spider або Sitebulb. Як це робиться покроково, ми описали в статті про технічний аудит сайту.
Якщо технічних перешкод немає, а статус — «Просканована, наразі не проіндексована», справа в самій сторінці. Google подивився й вирішив, що в індексі вона нічого не додає.
Типові випадки:
Рішення тут не технічне: або сторінці потрібен власний сенс, або її не має бути в індексі взагалі.
| Спосіб | Коли працює |
| Актуальна карта сайту в Search Console | Завжди. Базова гігієна: у sitemap лише адреси, що віддають 200 і відкриті для індексації |
| Запит на індексування через перевірку URL | Для окремих важливих сторінок. Це прохання, а не команда, і масово так робити не вийде |
| Внутрішні посилання з живих сторінок | Найнедооціненіший спосіб. Сторінка, на яку веде посилання з розділу, що часто оновлюється, сканується швидше |
| Оновлення розділу, у якому лежить сторінка | Робот повертається туди, де вміст змінюється |
| Швидкий сервер | Прямо впливає на те, скільки сторінок робот встигає обійти за візит |
| Зовнішні посилання | Працюють, але як побічний ефект — заради індексації їх не купують |
| Indexing API | Не для звичайних сторінок. Google офіційно підтримує його лише для вакансій (JobPosting) і трансляцій (BroadcastEvent). Поради застосовувати його до статей і карток товару суперечать документації |
Останній рядок варто підкреслити: Indexing API регулярно радять як універсальний прискорювач, хоча в документації Google прямо окреслено два типи контенту, для яких він призначений.
Краулінговий бюджет — кількість сторінок, яку робот готовий обійти на сайті за певний час. Тема популярна в статтях, але до більшості сайтів стосунку не має.
Google окреслює коло прямо: гайд по краулінговому бюджету потрібен великим сайтам від мільйона сторінок із вмістом, що змінюється хоча б раз на тиждень, і середнім сайтам від 10 тисяч сторінок із вмістом, що змінюється щодня. Окремо згадані сайти з великою кількістю адрес у статусі «Виявлена, наразі не проіндексована».
Для решти формулювання таке ж пряме: якщо сторінки сканують того ж дня, коли їх опублікували, цей гайд читати не потрібно — достатньо тримати карту сайту актуальною й регулярно дивитися звіт про індексування.
Практично це означає, що корпоративному сайту на 200 сторінок або магазину на 3000 позицій оптимізувати краулінговий бюджет нема чого. Якщо в них щось не індексується, причина в розділах 4 і 5, а не в бюджеті.
Перевірити, що саме заважає сторінкам потрапляти в індекс, ми можемо в межах SEO-аудиту, а виправити — у межах внутрішньої оптимізації. Офіційні пороги щодо краулінгового бюджету — у документації Google.
Звертайтесь!