Erstgespräch →
SEO

Robots.txt

Die robots.txt ist eine Textdatei, die Suchmaschinen-Crawlern mitteilt, welche Bereiche einer Website sie abrufen dürfen.

Robots.txt steuert Crawling, nicht zuverlässig die Indexierung – sensible Inhalte gehören hinter Zugriffsschutz.

Das Wichtigste in Kürze
  • Die Datei liegt im Stammverzeichnis der Domain.
  • User-agent bestimmt den angesprochenen Crawler.
  • Disallow und Allow steuern Pfade.
  • Sitemap kann auf XML-Sitemaps verweisen.
  • Fehler können große Websitebereiche blockieren.

Was bedeutet Robots.txt?

Das Robots Exclusion Protocol ermöglicht Websites, automatisierten Crawlern Regeln für den Abruf bereitzustellen. Die Datei ist öffentlich unter /robots.txt erreichbar.

Wie wird Robots.txt eingesetzt?

Vor dem Crawling lädt ein regelkonformer Bot die Datei, wählt die passende User-agent-Gruppe und prüft Pfadregeln. Die Interpretation kann je nach Crawler variieren.

Praxis und Einordnung

Ein Shop blockiert technische Filterparameter, prüft aber vorher, ob wichtige Produktressourcen oder indexierbare Seiten betroffen sind. Änderungen werden in einer Testumgebung validiert.

💡
Wichtig

Eine blockierte URL kann über externe Links trotzdem bekannt und in vereinfachter Form indexiert werden. Für Indexausschluss ist Noindex bei crawlbarer URL geeigneter.

Sinnvolle Umsetzung

Empfohlener Ablauf

  1. 1
    Ist-Zustand sichern

    Aktuelle Datei und wichtige Crawlingpfade werden dokumentiert.

  2. 2
    Regeln klein halten

    Nur eindeutig unnötige Bereiche werden blockiert.

  3. 3
    Syntax testen

    Crawlergruppen, Pfade und Großschreibung werden geprüft.

  4. 4
    Auswirkungen überwachen

    Search Console und Logs zeigen Crawl-Änderungen.

  5. 5
    Bei Migration prüfen

    Staging-Sperren dürfen nicht versehentlich live bleiben.

Crawling ist nicht gleich Indexierung

Eine Sperre in der robots.txt verhindert den Abruf, garantiert aber nicht, dass eine bereits bekannte URL aus Suchergebnissen verschwindet. Für die Entfernung müssen passende Indexierungs- und Statussignale verwendet werden.

Robots-Regeln sicher testen

Schon ein einzelner zu breiter Pfad kann wichtige Bereiche blockieren. Nach Relaunches, Staging-Übernahmen und Änderungen an URL-Strukturen sollten Regeln, Sitemap-Verweis und erreichbare Ressourcen geprüft werden.

Häufig gestellte Fragen

Häufige Fragen

Wo liegt robots.txt?+

Im Stammverzeichnis einer Domain, beispielsweise example.com/robots.txt.

Verhindert sie Indexierung?+

Nicht zuverlässig; sie steuert primär den Abruf.

Kann man geheime Dateien schützen?+

Nein. Die Datei ist öffentlich und kein Zugriffsschutz.

Was bedeutet User-agent: *?+

Die folgende Gruppe richtet sich an alle Bots, die keine spezifischere Regel verwenden.

Darf robots.txt fehlen?+

Ja. Dann gelten keine dort definierten Crawlingbeschränkungen.

← Zurück zum Glossar