Tester robots.txt: i motori di ricerca possono scansionare questa pagina?
Inserisci l'indirizzo di una pagina e scegli un crawler. Lo strumento legge il robots.txt del sito, trova la regola che decide e ti dice se la pagina può essere scansionata.
Questo strumento controlla una sola cosa. L'Analizzatore SEO del sito web con IA analizza tutto il tuo sito web: 23 controlli, tutte le pagine pubbliche, tre pagine lette a fondo e le parole chiave su cui puoi posizionarti.
Analizza la SEO del tuo sito web con l'IA →A cosa serve il robots.txt
Il robots.txt è un semplice file di testo nella cartella principale di un sito web (tuaazienda.it/robots.txt). I crawler lo leggono prima di qualsiasi altra cosa per sapere quali parti del sito possono visitare. È una richiesta, non un lucchetto: i crawler corretti come Googlebot e Bingbot la rispettano, mentre i bot malevoli la ignorano, quindi non affidarti mai al robots.txt per nascondere pagine private.
Come decide questo tester
- Trova il gruppo giusto. Il robots.txt è diviso in gruppi, ognuno dei quali inizia con una o più righe User-agent. Un crawler segue il gruppo il cui nome corrisponde meglio al suo (Googlebot-Image segue un gruppo Googlebot-Image, poi un gruppo Googlebot, poi il gruppo per tutti i crawler, *).
- Trova le regole che corrispondono all'indirizzo. Una regola corrisponde quando l'indirizzo inizia con il suo percorso. Un asterisco (*) sta per qualsiasi testo e il simbolo del dollaro ($) indica la fine dell'indirizzo.
- Vince la regola più specifica. Tra tutte le regole che corrispondono, decide quella con il percorso più lungo. Quando un Allow e un Disallow hanno la stessa lunghezza, vince Allow. Se nessuna regola corrisponde, la pagina può essere scansionata.
Sono le regole che Google pubblica e segue, quindi la risposta che ottieni qui è la stessa che riceve Googlebot.
Errori comuni
- Un Disallow: / rimasto dal sito di sviluppo, che esclude l'intero sito web dalla ricerca.
- Bloccare le cartelle CSS e JavaScript, così Google non riesce a visualizzare la pagina come la vedono i visitatori.
- Usare il robots.txt per togliere una pagina da Google. Una pagina bloccata può comparire lo stesso, senza descrizione, se altri siti la linkano. Usa invece un tag noindex, e lascia che la pagina venga scansionata così Google lo vede.
- Un robots.txt che risponde con un errore del server. In quel caso Google sospende la scansione di tutto il sito.
Il robots.txt è anche il posto migliore per indicare la tua sitemap, con una riga Sitemap. Controllala con lo strumento Verifica sitemap, e scopri come Google legge tutto il tuo sito con l'Analizzatore SEO del sito web con IA.
Tester robots.txt: domande e risposte
A cosa serve robots.txt?
Dice ai crawler quali parti di un sito possono visitare. Non rimuove pagine da Google: una pagina bloccata può comunque comparire nei risultati se altri siti la linkano. Per tenere una pagina fuori dai risultati, usa un tag noindex e lasciala scansionabile.
Quale regola prevale quando due regole corrispondono?
Google applica la regola più specifica, cioè quella con il percorso più lungo. Quando una regola Allow e una Disallow hanno la stessa lunghezza, vince Allow. Questo tester segue le stesse regole.
Cosa succede se un sito non ha un robots.txt?
Se robots.txt restituisce "non trovato", i crawler possono scansionare tutto. Se il server risponde con un errore (un codice 5xx), Google smette di scansionare il sito per un po', quindi un robots.txt guasto è peggio di nessuno.
Devo bloccare i crawler IA come GPTBot?
È una scelta aziendale. Bloccarli tiene i tuoi contenuti fuori da una parte dell'addestramento e delle risposte delle IA, ma può anche tenere la tua attività fuori dalle risposte che le persone leggono negli assistenti IA.
AI Web Maker