Googlebot è il nome del programma con cui Google individua, scarica e analizza le pagine del web per valutarne l’inserimento nel proprio indice. Appartiene alla categoria dei crawler, i programmi che percorrono i collegamenti fra i documenti pubblicati in rete raccogliendone il contenuto in modo automatico.

Comprendere il comportamento di Googlebot è rilevante per chiunque gestisca un sito, perché una pagina che non viene raggiunta o che viene esclusa dalla scansione non può comparire nei risultati di ricerca. La scansione è il primo dei passaggi necessari alla visibilità organica, distinto sia dall’indicizzazione sia dal posizionamento.

Come opera Googlebot

Il programma parte da un elenco di indirizzi già noti e da quelli segnalati attraverso una sitemap, scarica il contenuto di ciascuno ed estrae i collegamenti presenti, che vanno ad alimentare le scansioni successive. Le pagine scaricate vengono poi sottoposte a elaborazione, compresa l’esecuzione del codice necessario a visualizzare i contenuti caricati dinamicamente.

Scoperta degli indirizzi

Un indirizzo può diventare noto a Googlebot in diversi modi: un collegamento da una pagina già scansionata, la presenza in una sitemap, una richiesta esplicita inviata dagli strumenti per i proprietari di siti. Una pagina priva di collegamenti in entrata e assente dalla sitemap resta difficilmente raggiungibile, anche quando è tecnicamente accessibile a chi ne conosce l’indirizzo.

Frequenza della scansione

La frequenza con cui un sito viene visitato non è fissa. Dipende dalla capacità del server di rispondere senza rallentamenti e dall’interesse che il sistema attribuisce ai contenuti, valutato anche in base alla frequenza con cui cambiano. Un sito che risponde lentamente o restituisce errori ripetuti viene interrogato con maggiore cautela, mentre una risorsa aggiornata spesso e stabile tende a essere rivisitata più di frequente.

Le principali varianti di Googlebot

VarianteChe cosa raccoglieNota operativa
Googlebot SmartphoneLe pagine come le vedrebbe un dispositivo mobileÈ la modalità di riferimento per la maggior parte dei siti
Googlebot DesktopLe pagine nella versione per schermi ampiUsato in misura ridotta rispetto al passato
Googlebot ImageFile immagine collegati alle pagineAlimenta i risultati della ricerca per immagini
Googlebot VideoContenuti video e relativi dati descrittiviRichiede riferimenti corretti nel codice della pagina

Come si governa il comportamento di Googlebot

Il controllo non avviene con un’unica impostazione, ma attraverso strumenti distinti che agiscono su momenti diversi del processo.

  1. Definire nel file robots.txt quali percorsi non devono essere scansionati.
  2. Indicare con i metadati della singola pagina se questa possa comparire nei risultati.
  3. Dichiarare gli indirizzi rilevanti in una sitemap aggiornata e raggiungibile.
  4. Verificare negli strumenti per i proprietari di siti quali pagine risultano effettivamente scansionate e con quale esito.
  5. Correggere errori di risposta del server e catene di reindirizzamento che sprecano risorse di scansione.

Errori frequenti nella gestione della scansione

Confondere il blocco con l’esclusione

L’errore più comune consiste nel confondere il divieto di scansione con l’esclusione dai risultati. Impedire l’accesso a una pagina tramite il file di esclusione non garantisce che l’indirizzo non compaia in alcuna forma, perché il sistema può comunque conoscerlo attraverso collegamenti esterni; per escludere in modo affidabile una pagina occorre invece consentirne la lettura e dichiarare esplicitamente che non deve essere mostrata.

Un secondo errore riguarda il blocco involontario di risorse come fogli di stile e file di script: se non possono essere caricati, la pagina viene interpretata in una forma incompleta e diversa da quella vista dalle persone. La documentazione ufficiale sul funzionamento del crawler è disponibile nella pagina Googlebot di Google Search Central.

Indirizzi moltiplicati dai parametri

Un terzo problema ricorrente nasce dai parametri aggiunti agli indirizzi per ordinare, filtrare o tracciare la provenienza delle visite. Ogni combinazione produce un indirizzo formalmente diverso che conduce allo stesso contenuto, e il crawler può trovarsi a scansionare molte varianti della medesima pagina. L’effetto non è soltanto uno spreco di risorse: le pagine realmente nuove vengono raggiunte più tardi, perché la capacità di scansione disponibile viene consumata da duplicati. Le contromisure abituali consistono nel dichiarare quale sia l’indirizzo di riferimento per ciascun contenuto e nell’evitare che i collegamenti interni generino varianti non necessarie.

Verificare che si tratti davvero di Googlebot

Il nome con cui un programma si presenta al server può essere dichiarato liberamente, quindi non costituisce una prova di identità. Nei registri di accesso di qualsiasi sito compaiono regolarmente richieste che si annunciano come provenienti dal crawler di Google senza esserlo, talvolta per raccogliere contenuti, talvolta per sondare vulnerabilità. La verifica corretta non si basa sul nome dichiarato ma sull’indirizzo di provenienza, confrontato con gli intervalli pubblicati ufficialmente da Google. Bloccare un programma solo perché dichiara un nome diverso è un criterio inaffidabile, e nei casi peggiori porta a escludere il crawler autentico.

Domande frequenti su Googlebot

Googlebot indicizza tutte le pagine che scansiona?

No. La scansione precede l’indicizzazione, ma non la garantisce: una pagina può essere letta e comunque non essere inserita nell’indice, per esempio se il contenuto è duplicato o giudicato privo di valore autonomo.

Ogni quanto passa Googlebot su un sito?

Non esiste un intervallo fisso. La frequenza dipende dalla stabilità del server e dalla frequenza con cui i contenuti cambiano, e può variare fra sezioni diverse dello stesso sito.

È possibile riconoscere il vero Googlebot?

Sì. Il nome dichiarato dal programma può essere imitato, quindi la verifica corretta si basa sul controllo dell’indirizzo IP di provenienza secondo gli intervalli pubblicati ufficialmente.

Bloccare Googlebot migliora le prestazioni del server?

Può ridurre il carico, ma al prezzo dell’esclusione dai risultati di ricerca. Nella maggior parte dei casi conviene intervenire sulle prestazioni del sito anziché sulla scansione.

Googlebot esegue il codice JavaScript?

Sì, ma in un momento successivo rispetto al primo scaricamento della pagina. Un contenuto disponibile solo dopo l’esecuzione dello script può quindi essere rilevato con ritardo o, se il caricamento fallisce, non essere rilevato affatto.