Générer un fichier robots.txt
Générer un fichier propre robots.txt avec le plan du site et les règles de rampement.
Comment utiliser le Robots.txt Générateur
Choisissez l'agent utilisateur
Utilisez * pour chaque rampeur, ou n'en nommer qu'un quand une règle ne devrait s'appliquer qu'à lui.
Réglez vos chemins permis et refusez
Lister les chemins de rampeurs devrait sauter, comme les pages d'administration ou de recherche interne, et toutes exceptions à permettre.
Ajoutez votre plan du site et copiez
Entrez votre URL du sitemap, puis copiez le fichier et enregistrez-le en tant que robots.txt à la racine de votre domaine.
À propos de la Robots.txt Générateur
robots.txt est le premier fichier qu'un crawler demande et l'un des plus faciles à se tromper de façon catastrophique. Il est situé à la racine de votre domaine et indique aux crawlers quels chemins ils peuvent demander. Un clash errant dans une règle d'interdiction peut cacher un site entier de la recherche, et parce que rien ne rompt visiblement, cette erreur survit souvent pendant des mois avant que quelqu'un le relie au trafic qui n'est jamais arrivé.
La syntaxe est petite mais impitoyable : les règles sont assorties de préfixes, d'ordre et de spécificité interagissent, et un fichier vide ou mal formé est traité très différemment d'un fichier permissif. Cet outil construit un fichier valide à partir des parties qui vous intéressent réellement — lequel ramper une règle s'applique à, ce qu'il faut permettre, ce qu'il faut refuser, et où vit votre plan de site.
Une URL non autorisée peut encore apparaître dans les résultats si d'autres sites y sont reliés, et le fichier est public, donc listing un chemin secret l'annonce. Tout vraiment privé a besoin d'authentification ou d'une balise noindex, pas une ligne dans ce fichier. Utilisez-le pour garder les drawlers loin des chemins d'administration, les pages de résultats de recherche et les URL de paramètres dupliqués, et pour les pointer sur votre plan de site.
Foire aux questions
- Où puis-je mettre le fichier robots.txt ?
- À la racine de votre domaine, il est donc accessible sur votresite.com/robots.txt. Les crawlers ne regardent nulle part ailleurs.
- Est-ce que robots.txt arrête une page indexée ?
- Non. Il arrête de ramper, mais une URL bloquée peut encore être listée si d'autres sites y sont liés. Utilisez une balise noindex pour garder une page hors de l'index.
- Dois-je lister mon sitemap dans robots.txt?
- Oui. C'est la façon standard de pointer chaque rampeur sur votre plan du site sans le soumettre à chacun individuellement.