La direttiva disallow nel file robots.txt è un’istruzione che comunica ai crawler dei motori di ricerca quali aree di un sito web non devono essere esplorate o indicizzate. Si tratta di uno degli strumenti più utilizzati nell’ambito della SEO tecnica per gestire la scansione del sito da parte dei bot, come Googlebot o Bingbot, e per indirizzare le risorse di crawling verso le pagine realmente rilevanti.
Il file robots.txt si trova nella directory principale del dominio, ovvero all’indirizzo esempio.com/robots.txt, ed è composto da gruppi di direttive riferiti a specifici user-agent. All’interno di ciascun gruppo, la riga Disallow indica un percorso o una cartella che il crawler non deve visitare. Comprendere il funzionamento di questa direttiva è essenziale per evitare errori che possono compromettere la visibilità del sito sui motori di ricerca.
Come funziona la direttiva Disallow
La sintassi di base prevede la parola chiave Disallow seguita da due punti e dal percorso da escludere. Un gruppo tipico inizia con una riga User-agent che identifica il crawler a cui si applicano le regole, e prosegue con una o più righe Disallow. Se il valore è una barra seguita dal nome di una cartella, viene bloccata l’intera cartella e tutto ciò che contiene. Se il valore è vuoto, ovvero Disallow: senza percorso, il gruppo autorizza la scansione completa del sito per quello user-agent.
È importante ricordare che la direttiva disallow non impedisce in modo assoluto la presenza di una pagina nei risultati di ricerca. Un crawler rispettoso delle regole eviterà di scaricare la risorsa, ma se la pagina riceve link esterni potrebbe comunque comparire nei risultati senza una descrizione, oppure con una descrizione generata da altre fonti. Per escludere completamente una pagina dall’indice è necessario utilizzare altri strumenti, come il meta tag dedicato o l’intestazione HTTP corrispondente.
Differenza tra blocco della scansione e blocco dell’indicizzazione
Bloccare la scansione tramite robots.txt non equivale a impedire l’indicizzazione. Quando un crawler non può accedere a una pagina, non può nemmeno leggerne le istruzioni di indicizzazione. Di conseguenza, una pagina bloccata potrebbe essere indicizzata ugualmente se altri siti la linkano. Per una rimozione efficace è preferibile consentire la scansione e utilizzare una direttiva specifica che vieti l’inserimento nell’indice.
Sintassi e regole di scrittura
Il file robots.txt è un semplice file di testo codificato in UTF-8. Ogni riga contiene una direttiva, e le righe vuote o che iniziano con il simbolo di cancelletto vengono ignorate e trattate come commenti. I percorsi sono sensibili alle maiuscole e minuscole, quindi una cartella scritta in minuscolo non corrisponde alla stessa cartella scritta in maiuscolo.
Caratteri jolly e corrispondenze
I motori di ricerca più diffusi supportano due caratteri speciali all’interno dei percorsi. L’asterisco rappresenta una sequenza qualsiasi di caratteri, mentre il simbolo del dollaro indica la fine del percorso. Questi elementi permettono di creare regole flessibili, ad esempio per bloccare tutti gli indirizzi che terminano con una determinata estensione o che contengono un parametro specifico.
Ordine e priorità delle regole
Quando più regole si applicano allo stesso percorso, i crawler più evoluti adottano il criterio della corrispondenza più specifica, cioè la regola con il percorso più lungo e dettagliato. Questo comportamento riduce gli errori, ma non tutti i motori di ricerca lo gestiscono allo stesso modo, per cui è buona norma mantenere il file semplice e privo di conflitti.
Tabella comparativa degli strumenti di esclusione
| Strumento | Impedisce la scansione | Impedisce l’indicizzazione | Uso tipico |
|---|---|---|---|
| Disallow in robots.txt | Sì | No | Escludere aree interne o pagine di servizio dalla scansione |
| Meta tag noindex | No | Sì | Rimuovere singole pagine dai risultati di ricerca |
| Intestazione HTTP noindex | No | Sì | Escludere file non HTML come PDF e immagini |
| Protezione con password | Sì | Sì | Limitare l’accesso a contenuti riservati |
| Canonical | No | No | Indicare la versione preferita tra pagine simili |
Errori comuni e buone pratiche
Uno degli errori più gravi consiste nel bloccare l’intero sito con una riga Disallow: / destinata a tutti gli user-agent. Questa configurazione impedisce ai motori di ricerca di esplorare qualsiasi pagina e può portare alla rimozione progressiva del sito dall’indice. Un altro errore frequente è bloccare i file CSS e JavaScript necessari al rendering, perché i crawler moderni hanno bisogno di accedervi per valutare correttamente l’esperienza di pagina.
Per gestire correttamente la direttiva disallow è utile seguire alcune pratiche consolidate:
- Verificare sempre il file robots.txt prima di pubblicarlo, controllando che i percorsi siano scritti correttamente.
- Utilizzare lo strumento di test messo a disposizione dai principali motori di ricerca per simulare il comportamento del crawler.
- Non bloccare cartelle che contengono risorse necessarie al rendering delle pagine.
- Evitare di inserire percorsi con errori di battitura, perché una regola errata non produce alcun effetto.
- Preferire il meta tag noindex quando l’obiettivo è la rimozione dall’indice e non il risparmio di risorse di scansione.
- Mantenere il file aggiornato ogni volta che la struttura del sito cambia.
- Documentare le regole inserite, così da facilitarne la manutenzione nel tempo.
- Controllare periodicamente i report di scansione per individuare percorsi bloccati per errore.
Domande frequenti
Che cosa significa disallow nel file robots.txt?
Significa che il crawler indicato nella riga user-agent non deve esplorare il percorso specificato. È un’istruzione di esclusione dalla scansione, non un divieto assoluto di indicizzazione.
Bloccare una pagina con disallow la rimuove da Google?
Non necessariamente. Se la pagina riceve link da altri siti, può comunque comparire nei risultati di ricerca, anche se senza una descrizione completa. Per rimuoverla occorre agire sull’indicizzazione.
Dove si trova il file robots.txt?
Si trova nella directory principale del dominio, all’indirizzo esempio.com/robots.txt. Ogni sottodominio può avere un proprio file indipendente.
Posso usare disallow per bloccare una singola pagina?
Sì, indicando il percorso completo della pagina. Tuttavia, se l’obiettivo è escluderla dall’indice, è più efficace consentire la scansione e applicare una direttiva di non indicizzazione.
Che differenza c’è tra disallow e noindex?
Disallow impedisce al crawler di scaricare la pagina, mentre noindex gli consente di leggerla ma vieta di inserirla nell’indice. I due strumenti hanno effetti diversi e vanno scelti in base all’obiettivo.
Un file robots.txt errato può danneggiare la SEO?
Sì, un blocco accidentale dell’intero sito o di risorse essenziali può ridurre la visibilità sui motori di ricerca. Per questo è fondamentale testare il file prima della pubblicazione.
Voci correlate:
Indicizzazione seo Indicizzazione sito su google Robots.txt Noindex User agent
