Crawl Budget: Cos'è, Quando Conta Davvero e Come Diagnosticarlo

"Crawl budget" è uno dei termini SEO più fraintesi: viene spesso invocato come spiegazione per problemi di indicizzazione anche su siti piccoli, dove quasi sempre la causa reale è un'altra. Questa guida spiega cosa dice davvero Google in merito, per chi conta sul serio, e come verificarlo con dati propri invece che per sentito dire.

Cos'è il crawl budget

Secondo la documentazione ufficiale di Google, il crawl budget è "l'insieme di URL che Googlebot può e vuole sottoporre a scansione". Non è un numero fisso pubblicato da Google, né un valore che si vede direttamente in Search Console: è il risultato pratico di due fattori distinti, il limite di capacità di scansione e la domanda di scansione.

Crawl capacity limit vs crawl demand

Crawl capacity limit (hostload): quanta scansione il tuo server può sostenere senza rallentare. Google la regola in automatico: se il sito risponde in modo stabile e veloce, il limite può salire nel tempo; se il server rallenta, restituisce errori 5xx o segnali di rate-limiting (HTTP 429), Google riduce la scansione per non sovraccaricarlo.

Crawl demand: quanto Google vuole scansionare il sito, in base a fattori come dimensione percepita dell'inventario di URL, popolarità e "stantiezza" (staleness) percepita dei contenuti già indicizzati. Anche con un server velocissimo, se Google non ha motivo di credere che ci siano molte pagine nuove o aggiornate da controllare, non aumenterà la frequenza di scansione.

Quando il crawl budget conta davvero (e quando no)

Google è esplicito su questo punto, ed è la parte che la maggior parte degli articoli sull'argomento omette: la guida ufficiale è pensata per siti grandi con molte pagine che cambiano rapidamente, non per siti piccoli o a bassa frequenza di aggiornamento. Testualmente, Google indica come destinatari di questa ottimizzazione siti con più di circa un milione di pagine aggiornate con frequenza settimanale, o più di diecimila pagine aggiornate quotidianamente, oppure qualsiasi sito con un numero elevato di URL segnalati in Search Console come "Rilevato - attualmente non indicizzato".

Google stesso scrive che se il tuo sito non ha un grande numero di pagine che cambiano rapidamente, o se le pagine vengono scansionate lo stesso giorno in cui vengono pubblicate, il crawl budget probabilmente non è un problema che ti riguarda. Per la maggior parte dei siti di piccole e medie dimensioni — compresi la maggior parte dei siti aziendali e degli e-commerce con poche migliaia di prodotti — un problema di indicizzazione ha quasi sempre un'altra causa: contenuto duplicato, qualità percepita bassa, un errore tecnico specifico, o semplicemente un sito troppo nuovo e con poca autorevolezza (esattamente la situazione in cui si trova SEOdir.it oggi). Vale la pena escludere queste cause prima di concludere che il problema sia il crawl budget.

Cosa spreca davvero crawl budget

Quando il crawl budget è effettivamente un fattore rilevante, le cause tipiche di spreco documentate da Google includono:

  • Navigazione a faccette e URL con parametri che generano combinazioni quasi infinite della stessa lista di prodotti/contenuti;
  • Contenuto duplicato sotto URL diversi (varianti con/senza slash, parametri di sessione o tracciamento, versioni stampabili);
  • Errori soft 404: pagine che restituiscono HTTP 200 ma mostrano contenuto "pagina non trovata" o vuoto;
  • Catene di redirect lunghe, che costringono Googlebot a più richieste per raggiungere la destinazione finale;
  • Sitemap non aggiornate, che indirizzano risorse verso URL rimossi o non più rilevanti;
  • Contenuto di bassa qualità o spam, incluse pagine compromesse (hackerate) che generano spazi infiniti di URL generati dinamicamente.

robots.txt e noindex: cosa NON funziona

Un errore comune è pensare che aggiungere noindex a delle pagine "liberi" crawl budget per altre. Google chiarisce il contrario: una pagina con noindex viene comunque richiesta da Googlebot, che poi scarta la pagina dopo aver visto il tag — la scansione è comunque avvenuta, il tempo è comunque speso. Bloccare temporaneamente delle sezioni via robots.txt per "spostare" budget verso altre pagine, allo stesso modo, non funziona come ci si aspetterebbe: Google non sposta automaticamente quella capacità liberata verso altre pagine del sito, a meno che il sito non stia già saturando il proprio limite di capacità di scansione — condizione rara per la maggior parte dei siti.

Come capire se Googlebot sta davvero sprecando risorse

Il punto di partenza pratico è il report Statistiche di scansione (Crawl Stats) di Google Search Console, sotto Impostazioni: mostra l'andamento delle richieste di scansione nel tempo, la suddivisione per tipo di risposta (200, 404, redirect, errori server) e per tipo di file. Un rapporto con una quota elevata di richieste verso URL che rispondono con redirect, errori o contenuto duplicato è un segnale concreto — molto più affidabile di una sensazione generica di "indicizzazione lenta".

Per un'analisi più approfondita serve un crawler configurabile che simuli il comportamento di Googlebot sul proprio sito: strumenti come Screaming Frog o Sitebulb permettono di mappare l'intera struttura di URL, individuare catene di redirect, contenuto duplicato e pagine orfane prima ancora che Google le trovi da solo. Questo non sostituisce il log reale delle richieste di Googlebot (l'unica fonte davvero definitiva, disponibile solo analizzando i log del server), ma è il modo più accessibile per iniziare senza accesso ai log grezzi.

Workflow diagnostico in pratica

  1. Controlla il report Statistiche di scansione in Search Console: la quota di risposte 200 è alta, o prevalgono redirect/errori?
  2. Verifica quanti URL risultano "Rilevato - attualmente non indicizzato" nel report di copertura — è la spia più diretta che Google conosce più URL di quanti ne stia effettivamente scansionando.
  3. Esegui una scansione completa con Screaming Frog o Sitebulb per mappare redirect, duplicati e URL con parametri.
  4. Confronta il numero di URL trovati dal crawler con il numero di pagine che hanno davvero valore per gli utenti: se il rapporto è molto sbilanciato, il problema è quasi sempre la struttura del sito, non un limite di scansione imposto da Google.
  5. Aggiorna la sitemap XML in modo che contenga solo URL canonici e realmente indicizzabili — una sitemap pulita resta il modo più semplice di comunicare priorità a Google, anche se non è mai una garanzia di scansione.

Domande Frequenti

Ottimizzare il crawl budget migliora direttamente il posizionamento?
No. Google non lo dichiara mai come fattore di ranking diretto: un crawl budget più efficiente aiuta Google a trovare e aggiornare più velocemente le pagine importanti, ma non è di per sé un segnale di qualità o autorevolezza che migliora le posizioni.
Il mio sito piccolo ha un problema di crawl budget?
Nella grande maggioranza dei casi no. Google stessa indica che i siti con poche pagine, o le cui pagine vengono scansionate rapidamente dopo la pubblicazione, non hanno bisogno di preoccuparsene: un problema di indicizzazione su un sito piccolo ha quasi sempre un'altra causa (qualità dei contenuti, errori tecnici specifici, autorevolezza del dominio).
Il noindex libera crawl budget per altre pagine?
No. Una pagina con tag noindex viene comunque richiesta da Googlebot prima di essere scartata: il tempo di scansione è già stato speso nel momento in cui Google la richiede.
Dove vedo dati reali sulla scansione del mio sito?
Nel report Statistiche di scansione di Google Search Console (sezione Impostazioni), che mostra volume di richieste, tipo di risposta HTTP e tipo di file scansionato nel tempo. Per un'analisi indipendente da Google, un crawler come Screaming Frog o Sitebulb permette di simulare la scansione e trovare problemi strutturali in autonomia.