Google оновив документацію про crawl budget: що змінилося
Google суттєво переписав документацію про crawl budget і розкрив більше деталей про те, як система визначає інтенсивність сканування сайту.
Документ актуальний насамперед для великих ресурсів:
- сайтів із понад 1 млн сторінок, які регулярно оновлюються;
- сайтів із понад 10 000 сторінок і щоденними змінами;
- проєктів із великою кількістю URL у статусі Discovered — currently not indexed.
Для невеликих сайтів, сторінки яких Google сканує невдовзі після публікації, окрема оптимізація crawl budget зазвичай не потрібна.
1. Google починає з консервативного ліміту
Google прямо зазначив, що кожен сайт спочатку отримує однаковий консервативний crawl capacity limit.
Якщо попит на сканування зростає, а сервер стабільно витримує навантаження, Google може поступово збільшувати цей ліміт.
Якщо сайт відповідає повільно, повертає 5xx, 429 або має нестабільний Time to First Byte, інтенсивність сканування може знижуватися.
2. Crawl budget складається з двох частин
Google розділяє його на:
- crawl capacity limit — скільки сайт технічно може бути просканований без перевантаження сервера;
- crawl demand — скільки URL Google хоче просканувати.
Для Googlebot попит залежить від:
- розміру сайту;
- частоти оновлення;
- якості сторінок;
- релевантності;
- популярності URL;
- застарілості контенту.
Навіть якщо сервер дозволяє сканувати більше сторінок, Google не обов’язково це робитиме, якщо не бачить достатнього попиту.
3. Crawl capacity спільна для різних краулерів Google
Різні краулери мають власний попит, але використовують спільний ліміт потужності для конкретного hostname.
Це означає, що висока активність одного краулера, наприклад Googlebot-Image, AdsBot або Google Shopping, потенційно залишає менше доступної потужності для інших.
Для великих сайтів важливо аналізувати в логах не лише звичайний Googlebot, а всю екосистему краулерів Google.
4. Якість контенту впливає на crawl demand
Google окремо зазначив, що для Search враховуються:
- популярність;
- загальна цінність для користувача;
- унікальність контенту;
- здатність сервера стабільно віддавати сторінки.
Тому crawl budget не можна збільшити лише технічними налаштуваннями. Якщо сайт містить багато дублів, параметричних URL, слабких сторінок або непотрібних фільтрів, Google може витрачати ресурси неефективно й не бачити причин активніше сканувати важливі URL.
Що робити SEO-фахівцю:
1. Скоротити кількість дублів і непотрібних URL.
2. Перевірити faceted navigation, параметри та нескінченні crawl spaces.
3. Повернути 404 або 410 для остаточно видалених сторінок.
4. Актуалізувати XML Sitemap і коректно використовувати <lastmod>.
5. Прибрати довгі redirect chains.
6. Покращити швидкість відповіді сервера.
7. Налаштувати підтримку 304 Not Modified.
8. Аналізувати краулерів Google через server або CDN logs.
9. Покращувати унікальність і реальну цінність сторінок.
Головний висновок: crawl budget залежить не тільки від потужності сервера. Google враховує технічний стан сайту, структуру URL, якість контенту, частоту оновлень і реальний попит на повторне сканування.
Тому найкраща оптимізація crawl budget — не спроба змусити Googlebot ходити частіше, а створення сайту, де Google не витрачає ресурси на непотрібні URL і має причини регулярно повертатися до важливих сторінок.
Джерела:
- Google: Optimize your crawl budget — https://developers.google.com/crawling/docs/crawl-budget
- Google: What crawl budget means for Googlebot — https://developers.google.com/search/blog/2017/01/what-crawl-budget-means-for-googlebot