IT
Crea il mio sito web
Home›Strumenti SEO con IA›Tester robots.txt
Strumento SEO gratuito · senza registrazione

Tester robots.txt: i motori di ricerca possono scansionare questa pagina?

Inserisci l'indirizzo di una pagina e scegli un crawler. Lo strumento legge il robots.txt del sito, trova la regola che decide e ti dice se la pagina può essere scansionata.

Gratis · risultati in pochi secondi · leggiamo solo le pagine pubbliche

Questo strumento controlla una sola cosa. L'Analizzatore SEO del sito web con IA analizza tutto il tuo sito web: 23 controlli, tutte le pagine pubbliche, tre pagine lette a fondo e le parole chiave su cui puoi posizionarti.

Analizza la SEO del tuo sito web con l'IA →

A cosa serve il robots.txt

Il robots.txt è un semplice file di testo nella cartella principale di un sito web (tuaazienda.it/robots.txt). I crawler lo leggono prima di qualsiasi altra cosa per sapere quali parti del sito possono visitare. È una richiesta, non un lucchetto: i crawler corretti come Googlebot e Bingbot la rispettano, mentre i bot malevoli la ignorano, quindi non affidarti mai al robots.txt per nascondere pagine private.

Come decide questo tester

  1. Trova il gruppo giusto. Il robots.txt è diviso in gruppi, ognuno dei quali inizia con una o più righe User-agent. Un crawler segue il gruppo il cui nome corrisponde meglio al suo (Googlebot-Image segue un gruppo Googlebot-Image, poi un gruppo Googlebot, poi il gruppo per tutti i crawler, *).
  2. Trova le regole che corrispondono all'indirizzo. Una regola corrisponde quando l'indirizzo inizia con il suo percorso. Un asterisco (*) sta per qualsiasi testo e il simbolo del dollaro ($) indica la fine dell'indirizzo.
  3. Vince la regola più specifica. Tra tutte le regole che corrispondono, decide quella con il percorso più lungo. Quando un Allow e un Disallow hanno la stessa lunghezza, vince Allow. Se nessuna regola corrisponde, la pagina può essere scansionata.

Sono le regole che Google pubblica e segue, quindi la risposta che ottieni qui è la stessa che riceve Googlebot.

Errori comuni

  • Un Disallow: / rimasto dal sito di sviluppo, che esclude l'intero sito web dalla ricerca.
  • Bloccare le cartelle CSS e JavaScript, così Google non riesce a visualizzare la pagina come la vedono i visitatori.
  • Usare il robots.txt per togliere una pagina da Google. Una pagina bloccata può comparire lo stesso, senza descrizione, se altri siti la linkano. Usa invece un tag noindex, e lascia che la pagina venga scansionata così Google lo vede.
  • Un robots.txt che risponde con un errore del server. In quel caso Google sospende la scansione di tutto il sito.

Il robots.txt è anche il posto migliore per indicare la tua sitemap, con una riga Sitemap. Controllala con lo strumento Verifica sitemap, e scopri come Google legge tutto il tuo sito con l'Analizzatore SEO del sito web con IA.

Domande

Tester robots.txt: domande e risposte

A cosa serve robots.txt?

Dice ai crawler quali parti di un sito possono visitare. Non rimuove pagine da Google: una pagina bloccata può comunque comparire nei risultati se altri siti la linkano. Per tenere una pagina fuori dai risultati, usa un tag noindex e lasciala scansionabile.

Quale regola prevale quando due regole corrispondono?

Google applica la regola più specifica, cioè quella con il percorso più lungo. Quando una regola Allow e una Disallow hanno la stessa lunghezza, vince Allow. Questo tester segue le stesse regole.

Cosa succede se un sito non ha un robots.txt?

Se robots.txt restituisce "non trovato", i crawler possono scansionare tutto. Se il server risponde con un errore (un codice 5xx), Google smette di scansionare il sito per un po', quindi un robots.txt guasto è peggio di nessuno.

Devo bloccare i crawler IA come GPTBot?

È una scelta aziendale. Bloccarli tiene i tuoi contenuti fuori da una parte dell'addestramento e delle risposte delle IA, ma può anche tenere la tua attività fuori dalle risposte che le persone leggono negli assistenti IA.

Altri strumenti SEO gratuiti

Verifica il resto della tua SEO