Erstgespräch →
SEO

Crawling

Crawling bezeichnet den Prozess, bei dem Suchmaschinen automatisiert Webseiten aufrufen, Links verfolgen und Inhalte entdecken.

Nur was ein Crawler zuverlässig erreichen kann, hat eine realistische Chance, indexiert und in Suchergebnissen sichtbar zu werden.

Das Wichtigste in Kürze
  • Crawler entdecken URLs über Links, Sitemaps und bekannte Adressen.
  • Crawling ist nicht dasselbe wie Indexierung.
  • robots.txt kann Zugriffe steuern, garantiert aber keine Entfernung aus dem Index.
  • Interne Verlinkung beeinflusst die Auffindbarkeit wichtiger Seiten.
  • Serverfehler und endlose URL-Varianten verschwenden Crawl-Ressourcen.

Was ist Crawling?

Beim Crawling ruft ein Suchmaschinenbot Dokumente wie HTML-Seiten, Bilder oder PDFs ab. Die gefundenen Informationen und Links dienen als Grundlage für weitere Verarbeitung und eine mögliche Aufnahme in den Suchindex.

Wie funktioniert Crawling?

Ein Bot startet mit bekannten URLs, lädt deren Ressourcen und folgt erlaubten Verweisen. Dabei berücksichtigt er technische Signale, Serverantworten, Weiterleitungen und Regeln. Wie häufig eine URL besucht wird, hängt unter anderem von Bedeutung, Aktualität und technischer Erreichbarkeit ab.

Crawling in der Praxis

Große Shops und Portale erzeugen oft viele Filter-, Sortier- oder Parameter-URLs. Eine klare Architektur lenkt Bots zu wertvollen Seiten, während fehlerhafte Ketten, Kalenderfallen und Duplikate reduziert werden.

💡
Crawling ist keine Indexgarantie

Eine erfolgreich abgerufene URL kann trotzdem ausgeschlossen, als Duplikat bewertet oder aus Qualitätsgründen nicht indexiert werden.

Crawling sinnvoll optimieren

Empfohlener Ablauf

  1. 1
    Statuscodes prüfen

    Wichtige URLs liefern 200, dauerhafte Umzüge eine saubere 301-Weiterleitung.

  2. 2
    Interne Links stärken

    Zentrale Inhalte sind über kurze, verständliche Klickpfade erreichbar.

  3. 3
    Sitemap pflegen

    Nur kanonische, indexierbare URLs werden eingetragen.

  4. 4
    Crawl-Fallen reduzieren

    Unbegrenzte Parameter, facettierte Navigation und defekte Links werden kontrolliert.

  5. 5
    Logs und Berichte nutzen

    Serverlogs und Suchmaschinenberichte zeigen tatsächliche Bot-Aktivität und Fehler.

Wie Suchmaschinen eine Website crawlen

Beim Crawling folgen Suchmaschinen-Bots internen und externen Links, laden Seiteninhalte und entdecken dadurch neue oder aktualisierte URLs. Gefundene Inhalte können anschließend verarbeitet und in den Suchindex aufgenommen werden. Crawling und Indexierung sind daher nicht dasselbe: Eine erreichbare Seite wird nicht zwangsläufig indexiert oder für relevante Suchanfragen ausgespielt.

Eine klare interne Verlinkung, eine aktuelle XML-Sitemap und schnelle Serverantworten erleichtern Suchmaschinen die Erfassung wichtiger Seiten. Die robots.txt kann bestimmte Bereiche vom Crawling ausschließen, ersetzt aber keine sichere Zugriffskontrolle und garantiert keine Deindexierung. In der Google Search Console lassen sich Crawling- und Indexierungsprobleme erkennen, während Logfile-Analysen zeigen, welche URLs Bots tatsächlich besuchen.

Häufig gestellte Fragen

Häufige Fragen

Was ist ein Crawler?+

Ein automatisiertes Programm, das Webseiten und Links abruft und analysiert.

Was ist der Unterschied zwischen Crawling und Indexierung?+

Crawling ist der Abruf; Indexierung ist die mögliche Aufnahme und Verarbeitung im Suchindex.

Verhindert robots.txt eine Indexierung?+

Nicht zuverlässig. Sie steuert primär den Abruf und ist kein allgemeines Noindex-Signal.

Wie findet Google neue Seiten?+

Vor allem über Links, Sitemaps und bereits bekannte URL-Signale.

Was ist Crawl Budget?+

Es beschreibt vereinfacht die Ressourcen, die eine Suchmaschine für das Crawlen einer Website einsetzt.

← Zurück zum Glossar