Gerar um Ficheiro robots.txt
Gere um arquivo robots.txt limpo com regras de sitemap e crawl.
Como utilizar o Gerador Robots.txt
Escolha o agente de usuário
Use * para cada rastreador, ou nomeie um específico quando uma regra só deve aplicar-se a ele.
Defina os seus caminhos permitidos e não permitidos
Listar os caminhos rastreadores devem pular, como admin ou páginas de pesquisa internas, e quaisquer exceções para permitir.
Adicione o seu mapa do site e copie
Digite seu URL do mapa do site, em seguida, copie o arquivo e salve-o como robots.txt na raiz do seu domínio.
Sobre o Gerador Robots.txt
robots.txt é o primeiro ficheiro que um rastreador pede e um dos mais fáceis de obter catastróficamente errado. Ele senta-se na raiz do seu domínio e diz aos rastejantes quais os caminhos que podem solicitar. Um slash perdido numa regra de não autorização pode esconder um site inteiro da pesquisa, e porque nada se quebra visivelmente, esse erro muitas vezes sobrevive durante meses antes de alguém o ligar ao tráfego que nunca chegou.
A sintaxe é pequena, mas imperdoável: as regras são combinadas por prefixo, ordem e especificidade, e um arquivo em branco ou mal formado é tratado de forma muito diferente de um arquivo permissivo. Esta ferramenta constrói um arquivo válido das partes que você realmente se importa - qual rastreador uma regra se aplica, o que permitir, o que não permitir e onde seu mapa do site vive.
Uma coisa que vale a pena esclarecer: robots.txt controla o rastreamento, não a indexação ou o acesso. Uma URL não permitida pode ainda aparecer em resultados se outros sites se ligarem a ela, e o arquivo for público, listando assim um caminho secreto o anuncia. Qualquer coisa genuinamente privada precisa de autenticação ou uma tag noindex, não uma linha neste arquivo. Use-o para manter os rastreadores afastados dos caminhos de administração, páginas de resultados de pesquisa e URLs de parâmetros duplicados, e para apontá- los para o seu mapa do site.
Perguntas mais frequentes
- Onde coloco o arquivo robots.txt?
- Na raiz do seu domínio, então ele é acessível em yoursite.com/robots.txt. Crawlers não olhar em qualquer outro lugar.
- Os robôs.txt impedem uma página de ser indexada?
- Não. Ele pára de rastejar, mas um URL bloqueado ainda pode ser listado se outros sites se ligarem a ele. Use uma tag noindex para manter uma página fora do índice.
- Devo listar meu mapa do site em robots.txt?
- Sim. É a maneira padrão de apontar cada rastreador em seu mapa do site sem submetê-lo a cada um individualmente.