Testador de robots.txt: os mecanismos de busca podem rastrear esta página?
Digite o endereço de uma página e escolha um rastreador. O testador lê o robots.txt do site, encontra a regra que decide e diz se a página pode ser rastreada.
Esta ferramenta verifica uma coisa só. O Verificador de SEO de sites com IA analisa seu site inteiro: 23 verificações, todas as páginas públicas, três páginas lidas em profundidade e as palavras-chave que você pode conquistar.
Analise o SEO do seu site com IA →Para que serve o robots.txt
O robots.txt é um arquivo de texto simples na raiz de um site (suaempresa.com.br/robots.txt). Os rastreadores o leem antes de qualquer outra coisa para saber quais partes do site podem visitar. É um pedido, não uma tranca: rastreadores bem-comportados, como o Googlebot e o Bingbot, obedecem, enquanto bots mal-intencionados o ignoram, então nunca conte com ele para esconder páginas privadas.
Como este testador decide
- Ele encontra o grupo certo. O robots.txt é dividido em grupos, cada um começando com uma ou mais linhas User-agent. Um rastreador segue o grupo cujo nome corresponde a ele com mais precisão (o Googlebot-Image segue um grupo Googlebot-Image, na falta dele um grupo Googlebot e, por último, o grupo de todos os rastreadores, *).
- Ele encontra as regras que correspondem ao endereço. Uma regra corresponde quando o endereço começa com o caminho dela. Um asterisco (*) representa qualquer texto e um cifrão ($) marca o fim do endereço.
- A regra mais específica vence. De todas as regras que correspondem, decide a que tem o caminho mais longo. Quando um Allow e um Disallow têm o mesmo tamanho, o Allow vence. Se nenhuma regra corresponder, a página pode ser rastreada.
Essas são as regras que o Google publica e segue, então a resposta aqui é a mesma que o Googlebot recebe.
Erros comuns
- Disallow: / esquecido do site de desenvolvimento, o que tira o site inteiro da busca.
- Bloquear as pastas de CSS e JavaScript, o que impede o Google de renderizar a página como os visitantes a veem.
- Usar o robots.txt para tirar uma página do Google. Uma página bloqueada ainda pode aparecer, sem descrição, se outros sites tiverem links para ela. Use uma tag noindex no lugar e deixe a página ser rastreada para que o Google veja a tag.
- Um robots.txt que responde com erro do servidor. Nesse caso, o Google pausa o rastreamento do site inteiro.
O robots.txt também é o melhor lugar para indicar o seu sitemap, com uma linha Sitemap. Confira o sitemap com o verificador de sitemap e veja como o Google lê o seu site inteiro com o Verificador de SEO de sites com IA.
Testador de robots.txt: perguntas e respostas
Para que serve o robots.txt?
Ele diz aos rastreadores quais partes de um site eles podem visitar. Ele não remove páginas do Google: uma página bloqueada ainda pode aparecer se outros sites tiverem links para ela. Para manter uma página fora dos resultados, use uma tag noindex e deixe-a rastreável.
Qual regra vale quando duas regras se aplicam?
O Google usa a regra mais específica, a que tem o caminho mais longo. Quando uma regra Allow e uma Disallow têm o mesmo tamanho, a Allow vence. Este testador segue as mesmas regras.
O que acontece quando um site não tem robots.txt?
Se o robots.txt retorna "não encontrado", os rastreadores podem rastrear tudo. Se o servidor responde com um erro (um código 5xx), o Google para de rastrear o site por um tempo, então um robots.txt com defeito é pior do que nenhum.
Devo bloquear rastreadores de IA como o GPTBot?
É uma decisão de negócio. Bloqueá-los mantém seu conteúdo fora de alguns treinamentos e respostas de IA, mas também pode deixar seu negócio fora das respostas que as pessoas leem nos assistentes de IA.
AI Web Maker