ALL SYSTEMS OPERATIONALUPTIME 99.97%FLEET 18/18IN-MUM · US-LAX · EU-FSN EST. 2003 · +91 11 4998 4038

KENNTNISSE

Robots.txt erklärt

Letzte Aktualisierung 2025-06-06

Robots.txt erklärt in Kürze:

Robots.txt ist ein nützliches Werkzeug, wenn es verwendet wird, um den Roboterzugriff auf Ihre Website zu beschränken, wie z. B. Inhalte in der Arbeit und sensible Informationen. Derzeit gibt es keine Unterstützung durch die Robots Exclusion Standard Working Group für eine Genehmigungsrichtlinie, die Roboter dazu bringen würde, Teile von die Website. Dies kann immer noch durch interne und externe Verknüpfung mit Ihrer Website initiiert werden.

Möglicherweise haben Sie bei der Überprüfung Ihrer Website-Nutzungsstatistik einen Verweis auf eine Datei mit dem Namen "robots.txt" bemerkt. Dies ist eine grundlegende Konfigurationsdatei, die Roboter (Suchmaschinenspinnen) verwenden, um zu notieren, welche Dateien und Verzeichnisse sie nicht indizieren sollten.

It is important to have a file called robots.txt in the root of your website (http://www.yourdomain.com/robots.txt)Die grundlegende Verwendung von robots.txt besteht darin, zu notieren, welche Dateien und Verzeichnisse die Roboter nicht indizieren sollten.

There are 2 components to the syntax of the robots.txt file structure: the user agent line and the disallow line.

Die Syntax ist wie folgt:

User-Agent
A list of the robots visiting your site may be viewed in the stats logs of your website. A listing of user-agents may be viewed at http://www.robotstxt.org/wc/active.html

Ein bestimmter Roboter kann in der User-Agent-Syntax referenziert werden.

User-Agent: Googlebot

Eine Platzhalter kann auch verwendet werden, um alle robots.txt-Dateien zuzuordnen.

User-Agent: *

Disallow
In diesem Abschnitt der Syntax heißt es, welche Dateien und Verzeichnisse nicht indiziert werden sollten.

Wenn Sie eine Seite mit dem Namen 'addresses.html' haben und nicht möchten, dass der Roboter sie indiziert , fügen Sie die folgende Zeile nach der User-Agent-Syntax hinzu:

Nicht zulassen: address.html

Sie können den Roboter auch auf Verzeichnisebene einschränken. Wenn das Verzeichnis "/billing" auf Ihrer Website von der Indexierung eingeschränkt werden sollte, legen Sie den folgenden Text nach der Benutzer-Agent-Syntax.

Nichtzulässig: /billing/

Eine Platzhalter kann auch verwendet werden, um alle Dateien auf einer Website zu notieren.

Nichtzulässig: /

Wie mache ich Kommentare in meiner robots.txt-Datei?
Codierungskommentare können in der robots.txt-Datei platziert werden, indem Sie vor einem beliebigen Text "#" platzieren. Ein Beispiel ist:

# gibt Googlebot als User-Agent an.
User-Agent: Googlebot

Es ist eine gute Praxis, Ihre Kommentare in einer anderen Zeile als der Richtlinie. Begrenzen Sie auch den Weißraum am Anfang der Direktive.


Verwenden von robots.txt:
Jetzt, da wir die Funktionalität von robots.txt kennen, lassen Sie es uns in die Praxis umsetzen.

Wenn Sie ALLEN Robotern erlauben möchten, ALLE Seiten auf Ihrer Website zu besuchen, sollten Sie die Platzhalter "*" in Ihrer Syntax in der robots.txt-Datei verwenden.

User-Agent: *
Nichtzulässig:

Um jegliche Indexierung Ihrer Website zu verbieten, geben Sie den folgenden Text in Ihre robots.txt-Datei ein:

User-Agent: *
Nichtzulässig: /

Robotern die Indexierung von Seiten innerhalb eines Verzeichnisses mit dem Namen "Billing" verbieten.

User-Agent: *
Nichtzulässig: /billing/

Roboter von der Indexierung von Seiten innerhalb von Verzeichnissen mit den Bezeichnungen "Billing" und "Adresse" ausschließen.

User-Agent: *
Nichtzulässig: /billing/
Nichtzulässig: /Adresse/

Verweigern Sie Googlebot von Ihrer Website.

User-Agent: Googlebot
Nichtzulässig: /

Verhindern Sie, dass Googlebot auf Ihre Kontaktseite zugreift (contact-us.html).

User-Agent: Googlebot
Nicht zulassen: /contact-us.html

Verhindern Sie, dass Googlebot auf Ihre Kontaktseite zugreift (about-us/contact-us.html).

User-Agent: Googlebot
Nicht zulassen: /about-us/contact-us.html
 

Begrenzung der Raupen

Wenn Sie viele Links auf Ihrer Website haben (z. B. wenn Sie Foren haben), besteht die Möglichkeit, dass der Yahoo-Bot die Links zu schnell crawlt und am Ende viel Bandbreite und andere Ressourcen verbraucht. Um dies zu verhindern, fügen Sie diese Zeilen zu Ihrer robots.txt-Datei hinzu:

User-Agent: Slurp
Crawl-Verzögerung: 60

Dies wird Yahoo Slurp sagen, nur eine Seite alle 60 Sekunden zu crawlen.

← Alle Knowledgebase Artikel

Sagen Sie uns, was aufbleiben muss.

A short conversation with an engineer. No quote-bot, no callback queue. We'll tell you honestly if we're not the right fit.