RB

Gerar um Ficheiro robots.txt

Gere um arquivo robots.txt limpo com regras de sitemap e crawl.

Como utilizar o Gerador Robots.txt

  1. Escolha o agente de usuário

    Use * para cada rastreador, ou nomeie um específico quando uma regra só deve aplicar-se a ele.

  2. Defina os seus caminhos permitidos e não permitidos

    Listar os caminhos rastreadores devem pular, como admin ou páginas de pesquisa internas, e quaisquer exceções para permitir.

  3. Adicione o seu mapa do site e copie

    Digite seu URL do mapa do site, em seguida, copie o arquivo e salve-o como robots.txt na raiz do seu domínio.

Sobre o Gerador Robots.txt

robots.txt é o primeiro ficheiro que um rastreador pede e um dos mais fáceis de obter catastróficamente errado. Ele senta-se na raiz do seu domínio e diz aos rastejantes quais os caminhos que podem solicitar. Um slash perdido numa regra de não autorização pode esconder um site inteiro da pesquisa, e porque nada se quebra visivelmente, esse erro muitas vezes sobrevive durante meses antes de alguém o ligar ao tráfego que nunca chegou.

A sintaxe é pequena, mas imperdoável: as regras são combinadas por prefixo, ordem e especificidade, e um arquivo em branco ou mal formado é tratado de forma muito diferente de um arquivo permissivo. Esta ferramenta constrói um arquivo válido das partes que você realmente se importa - qual rastreador uma regra se aplica, o que permitir, o que não permitir e onde seu mapa do site vive.

Uma coisa que vale a pena esclarecer: robots.txt controla o rastreamento, não a indexação ou o acesso. Uma URL não permitida pode ainda aparecer em resultados se outros sites se ligarem a ela, e o arquivo for público, listando assim um caminho secreto o anuncia. Qualquer coisa genuinamente privada precisa de autenticação ou uma tag noindex, não uma linha neste arquivo. Use-o para manter os rastreadores afastados dos caminhos de administração, páginas de resultados de pesquisa e URLs de parâmetros duplicados, e para apontá- los para o seu mapa do site.

Perguntas mais frequentes

Onde coloco o arquivo robots.txt?
Na raiz do seu domínio, então ele é acessível em yoursite.com/robots.txt. Crawlers não olhar em qualquer outro lugar.
Os robôs.txt impedem uma página de ser indexada?
Não. Ele pára de rastejar, mas um URL bloqueado ainda pode ser listado se outros sites se ligarem a ele. Use uma tag noindex para manter uma página fora do índice.
Devo listar meu mapa do site em robots.txt?
Sim. É a maneira padrão de apontar cada rastreador em seu mapa do site sem submetê-lo a cada um individualmente.

Ferramentas relacionadas