Die robots.txt ist eine Textdatei, die Suchmaschinen-Crawlern mitteilt, welche Bereiche einer Website sie abrufen dürfen.
Robots.txt steuert Crawling, nicht zuverlässig die Indexierung – sensible Inhalte gehören hinter Zugriffsschutz.
- ✓Die Datei liegt im Stammverzeichnis der Domain.
- ✓User-agent bestimmt den angesprochenen Crawler.
- ✓Disallow und Allow steuern Pfade.
- ✓Sitemap kann auf XML-Sitemaps verweisen.
- ✓Fehler können große Websitebereiche blockieren.
Was bedeutet Robots.txt?
Das Robots Exclusion Protocol ermöglicht Websites, automatisierten Crawlern Regeln für den Abruf bereitzustellen. Die Datei ist öffentlich unter /robots.txt erreichbar.
Wie wird Robots.txt eingesetzt?
Vor dem Crawling lädt ein regelkonformer Bot die Datei, wählt die passende User-agent-Gruppe und prüft Pfadregeln. Die Interpretation kann je nach Crawler variieren.
Benennt den Crawler, für den folgende Regeln gelten.
Schließt passende Pfade vom Abruf aus.
Erlaubt innerhalb eines blockierten Bereichs spezifische Pfade.
Verweist auf den Speicherort einer XML-Sitemap.
Praxis und Einordnung
Ein Shop blockiert technische Filterparameter, prüft aber vorher, ob wichtige Produktressourcen oder indexierbare Seiten betroffen sind. Änderungen werden in einer Testumgebung validiert.
Eine blockierte URL kann über externe Links trotzdem bekannt und in vereinfachter Form indexiert werden. Für Indexausschluss ist Noindex bei crawlbarer URL geeigneter.
Sinnvolle Umsetzung
Empfohlener Ablauf
-
1
Ist-Zustand sichern
Aktuelle Datei und wichtige Crawlingpfade werden dokumentiert.
-
2
Regeln klein halten
Nur eindeutig unnötige Bereiche werden blockiert.
-
3
Syntax testen
Crawlergruppen, Pfade und Großschreibung werden geprüft.
-
4
Auswirkungen überwachen
Search Console und Logs zeigen Crawl-Änderungen.
-
5
Bei Migration prüfen
Staging-Sperren dürfen nicht versehentlich live bleiben.
Crawling ist nicht gleich Indexierung
Eine Sperre in der robots.txt verhindert den Abruf, garantiert aber nicht, dass eine bereits bekannte URL aus Suchergebnissen verschwindet. Für die Entfernung müssen passende Indexierungs- und Statussignale verwendet werden.
Robots-Regeln sicher testen
Schon ein einzelner zu breiter Pfad kann wichtige Bereiche blockieren. Nach Relaunches, Staging-Übernahmen und Änderungen an URL-Strukturen sollten Regeln, Sitemap-Verweis und erreichbare Ressourcen geprüft werden.
Häufig gestellte Fragen
Häufige Fragen
Wo liegt robots.txt?+
Im Stammverzeichnis einer Domain, beispielsweise example.com/robots.txt.
Verhindert sie Indexierung?+
Nicht zuverlässig; sie steuert primär den Abruf.
Kann man geheime Dateien schützen?+
Nein. Die Datei ist öffentlich und kein Zugriffsschutz.
Was bedeutet User-agent: *?+
Die folgende Gruppe richtet sich an alle Bots, die keine spezifischere Regel verwenden.
Darf robots.txt fehlen?+
Ja. Dann gelten keine dort definierten Crawlingbeschränkungen.
