Generieren Sie eine robots.txt Datei
Generieren Sie eine saubere robots.txt-Datei mit Sitemap und Crawl-Regeln.
Wie man die Robots.txt Generator
Wählen Sie den User Agent
Verwenden Sie * für jeden Crawler oder benennen Sie einen bestimmten, wenn eine Regel nur für ihn gelten soll.
Legen Sie Ihre Erlaubnis und Nichtzulassung Pfade
Listen Sie die Pfade auf, die Crawler überspringen sollten, wie z. B. Admin- oder interne Suchseiten, und alle Ausnahmen, die Sie zulassen sollten.
Fügen Sie Ihre Sitemap und Kopie hinzu
Geben Sie Ihre Sitemap-URL ein, kopieren Sie die Datei und speichern Sie sie als robots.txt am Stamm Ihrer Domain.
Über die Robots.txt Generator
Robots.txt ist die erste Datei, die ein Crawler anfordert und eine der am einfachsten zu bekommenden katastrophalen Fehler. Sie sitzt an der Wurzel Ihrer Domain und sagt Crawlern, welche Pfade sie anfordern können. Ein verirrter Schrägstrich in einer Nicht-Zulassungsregel kann eine ganze Site vor der Suche verbergen, und weil nichts sichtbar bricht, überlebt dieser Fehler oft Monate, bevor jemand ihn mit dem Verkehr verbindet, der nie angekommen ist.
Die Syntax ist klein, aber unversöhnlich: Regeln werden durch Präfixe ergänzt, Ordnung und Spezifität interagieren, und eine leere oder fehlerhafte Datei wird sehr unterschiedlich behandelt als eine permissive. Dieses Tool erstellt eine gültige Datei aus den Teilen, die Ihnen eigentlich wichtig sind – für welchen Crawler eine Regel gilt, was erlaubt wird, was nicht erlaubt wird und wo Ihre Sitemap lebt.
Eines sollte man sich klarmachen: robots.txt kontrolliert das Crawlen, nicht Indizieren oder Zugreifen. Eine unzulässige URL kann immer noch in den Ergebnissen erscheinen, wenn andere Seiten darauf verlinken, und die Datei ist öffentlich, so dass die Auflistung eines geheimen Pfades sie ausgibt. Alles, was wirklich privat ist, braucht Authentifizierung oder ein Noindex-Tag, keine Zeile in dieser Datei. Verwenden Sie es, um Crawler von Admin-Pfaden, Suchergebnisseiten und doppelten Parameter-URLs fernzuhalten und sie auf Ihre Sitemap zu verweisen.
Häufig gestellte Fragen
- Wo stelle ich die robots.txt-Datei ein?
- An der Wurzel Ihrer Domain, so ist es erreichbar auf yoursite.com/robots.txt. Crawlers suchen nirgendwo anders.
- Stoppt robots.txt die Indexierung einer Seite?
- Nein. Es stoppt das Crawlen, aber eine blockierte URL kann immer noch aufgelistet werden, wenn andere Websites darauf verlinken.
- Soll ich meine Sitemap in robots.txt auflisten?
- Ja. Es ist die Standardmethode, jeden Crawler auf Ihre Sitemap zu richten, ohne sie jedem einzeln zu übermitteln.