Il crawling è l’insieme delle operazioni con cui un motore di ricerca scopre e scarica le pagine presenti sul web, per poi inserirle in un archivio consultabile. In termini tecnici, indica l’attività svolta da un programma automatizzato, detto crawler o spider, che naviga i collegamenti ipertestuali da una pagina all’altra seguendo una coda di indirizzi da visitare. Senza questa fase preliminare, nessun contenuto potrebbe essere indicizzato e quindi mostrato nei risultati di ricerca.
Per chi si occupa di ottimizzazione per i motori di ricerca, comprendere il crawling significa capire come i contenuti vengono scoperti, con quale frequenza vengono ricontrollati e quali ostacoli possono impedirne la lettura. Un sito tecnicamente accessibile e ben collegato viene esplorato in modo più efficiente, con effetti positivi sulla tempestività dell’indicizzazione e sulla visibilità complessiva.
Che cosa significa crawling
Il termine deriva dal verbo inglese che indica lo strisciare o il muoversi lentamente, immagine che descrive bene il procedere del crawler da un indirizzo all’altro. Il programma riceve un elenco iniziale di URL, li scarica, ne analizza il codice e ne estrae i collegamenti, che entrano in una coda di lavoro. Il processo si ripete in modo ciclico e continuo, perché il web cambia di continuo e le pagine già note devono essere ricontrollate.
Il crawling non va confuso con l’indicizzazione: il primo è la fase di raccolta, il secondo è la fase di archiviazione e interpretazione dei contenuti. Una pagina può essere sottoposta a crawling senza poi essere indicizzata, ad esempio se presenta contenuti duplicati o di qualità insufficiente.
Come funziona un crawler
Un crawler opera combinando tre attività principali: la scoperta degli URL, la richiesta dei documenti e l’estrazione dei nuovi collegamenti. La scoperta avviene tramite collegamenti interni ed esterni, mappe del sito e segnalazioni dirette. La richiesta consiste nel recupero del documento dal server che lo ospita. L’estrazione permette di alimentare la coda con nuovi indirizzi da visitare.
Ogni motore di ricerca adotta proprie politiche di priorità, frequenza e capacità di elaborazione. Alcuni indirizzi vengono visitati spesso, altri raramente, in base a segnali come l’autorevolezza del sito, la frequenza di aggiornamento e la popolarità dei collegamenti in entrata.
Il ruolo della coda di URL
La coda è l’elenco ordinato degli indirizzi in attesa di essere visitati. La sua gestione determina l’ordine e la velocità dell’esplorazione: gli URL ritenuti più importanti vengono anteposti, mentre quelli già noti e poco modificati possono essere rimandati. Una coda ben bilanciata evita di sovraccaricare i server e di sprecare risorse su pagine di scarso valore.
Crawling e budget di scansione
Il budget di scansione è la quantità di risorse che un motore di ricerca decide di dedicare a un singolo sito in un dato periodo. Dipende dalle risorse del motore e dalla popolarità del sito. Se il budget è limitato, le pagine meno rilevanti rischiano di essere visitate di rado, con conseguente ritardo nell’aggiornamento dei contenuti.
Fattori che influenzano il crawling
Diversi elementi determinano se e quanto spesso una pagina viene esplorata. Tra questi figurano l’architettura del sito, la qualità dei collegamenti interni, la velocità di risposta del server, la presenza di contenuti duplicati e l’uso di direttive specifiche. Anche la frequenza di pubblicazione di nuovi contenuti incide sulla propensione del crawler a tornare.
Un sito con una struttura chiara e collegamenti coerenti facilita il lavoro del crawler. Al contrario, menu complessi, pagine orfane e catene di reindirizzamenti rallentano o bloccano l’esplorazione.
Direttive per i crawler
Esistono strumenti che permettono ai gestori di siti di comunicare ai crawler quali aree esplorare e quali evitare. Il file di regole posto nella directory principale del dominio indica quali percorsi non devono essere visitati, mentre un’apposita etichetta inserita nel codice di una pagina può richiedere di non seguire i collegamenti o di non mostrare la pagina nei risultati. Queste direttive sono richieste, non ordini assoluti, e i motori più diffusi le rispettano volontariamente.
Errori che bloccano l’esplorazione
Uno dei problemi più comuni è il blocco involontario del crawler tramite regole troppo restrittive. Altri ostacoli includono errori del server, tempi di risposta eccessivi, contenuti caricati solo tramite interazione dell’utente e collegamenti non funzionanti. Anche una mappa del sito assente o non aggiornata può rallentare la scoperta delle pagine nuove.
Confronto tra concetti correlati
| Concetto | Definizione | Obiettivo | Chi lo esegue |
|---|---|---|---|
| Crawling | Scoperta e scaricamento delle pagine | Raccogliere contenuti | Crawler del motore |
| Indicizzazione | Archiviazione e interpretazione dei contenuti | Rendere le pagine ricercabili | Sistema di indicizzazione |
| Rendering | Esecuzione del codice per ottenere la pagina finale | Leggere contenuti dinamici | Motore di rendering |
| Scansione del sito | Analisi completa delle pagine di un dominio | Verificare stato e collegamenti | Strumenti di analisi |
| Mappa del sito | Elenco strutturato degli URL di un sito | Facilitare la scoperta | Gestore del sito |
Buone pratiche per favorire il crawling
- Mantieni una struttura di collegamenti interni chiara e coerente, così che ogni pagina importante sia raggiungibile in pochi passaggi dalla home.
- Pubblica e aggiorna una mappa del sito in formato standard, indicando gli URL principali e le date di ultima modifica.
- Evita i reindirizzamenti in catena e correggi i collegamenti non funzionanti, che disperdono risorse e confondono i crawler.
- Controlla le regole di esclusione per assicurarti di non bloccare per errore pagine che desideri indicizzare.
- Riduci i contenuti duplicati o molto simili, che possono diluire l’attenzione del crawler su più indirizzi equivalenti.
- Migliora la velocità di risposta del server, perché tempi lunghi riducono la quantità di pagine visitate.
- Monitora regolarmente i report di copertura e gli errori di esplorazione messi a disposizione dagli strumenti per i webmaster.
- Aggiorna con regolarità i contenuti esistenti, così da incentivare visite più frequenti del crawler.
Domande frequenti
Che differenza c’è tra crawling e indicizzazione?
Il crawling è la fase in cui il motore scopre e scarica le pagine, mentre l’indicizzazione è la fase in cui le analizza e le archivia. Una pagina può essere sottoposta a crawling senza essere poi indicizzata.
Ogni quanto tempo un motore di ricerca visita un sito?
Non esiste una frequenza fissa: dipende dall’autorevolezza del sito, dalla frequenza di aggiornamento e dalle risorse del motore. I siti aggiornati spesso tendono a essere visitati più di frequente.
Perché alcune pagine non vengono mai esplorate?
Spesso accade perché non sono collegate da nessun’altra pagina, oppure perché sono bloccate da regole di esclusione o da errori tecnici. Anche un budget di scansione limitato può ritardarne la scoperta.
Il crawling consuma risorse del server?
Sì, ogni visita del crawler genera richieste al server. Per questo i motori di ricerca regolano la frequenza e la velocità delle richieste, in modo da non compromettere la disponibilità del sito.
Posso impedire del tutto il crawling del mio sito?
È possibile indicare ai crawler di non visitare l’intero dominio tramite le regole di esclusione. Va però ricordato che queste direttive sono volontarie e non impediscono l’accesso a chi non le rispetta.
Il crawling riguarda anche immagini e video?
Sì, i crawler moderni esplorano anche risorse multimediali come immagini e video, oltre ai documenti testuali. La loro indicizzazione segue però criteri specifici e differenti da quelli delle pagine.
