tomai
Anmelden
Kostenlos · SEO-Tools

Robots.txt-Prüfung

Lädt die robots.txt einer Website und prüft, ob ein Crawler einen Pfad abrufen darf — nach den echten Crawling-Regeln, mit Anzeige der entscheidenden Zeile.

Geben Sie eine http(s)-URL ein — ein konkreter Pfad wie /private/admin ist ok. Die Prüfung lädt die robots.txt dieser Site und testet genau diesen Pfad dagegen.
Der Bot, dessen Regeln entscheiden. Es gilt Präfix-Matching — “Googlebot” deckt auch Googlebot-News, Googlebot-Image… ab.
URL und Crawler eingeben, dann auf “Zugriff prüfen” klicken. Die Antwort zeigt, ob dieser Crawler den Pfad laut der echten robots.txt abrufen darf.

Häufige Fragen

Was bedeuten die Ergebnisse wirklich?

Das Ergebnis gilt für genau ein (Crawler, Pfad)-Paar: “Erlaubt“ oder “Gesperrt“ laut der echten robots.txt der Site. Die Seite zeigt, aus welcher User-Agent-Gruppe die Regeln stammen und welche einzelne Regel entschieden hat. Die Bewertung folgt exakt RFC 9309: das längste passende Muster gewinnt, ein Allow schlägt ein gleich langes Disallow, * passt auf beliebige Zeichen inklusive Slash, ein abschließendes $ verankert das Ende, und ohne passende Regel ist alles erlaubt. Ein Disallow mit leerem Wert ist wirkungslos — so behandeln es auch die großen Suchmaschinen.

Warum deckt Googlebot auch Googlebot-News und Googlebot-Image ab?

RFC 9309 besagt, dass User-Agent-Gruppen als nicht fallunterscheidendes PRÄFIX des Bot-Tokens gematcht werden — eine Gruppe für “Googlebot“ regelt daher auch Googlebot-News, Googlebot-Image, Googlebot-Video usw. Sites verlassen sich darauf, um für die ganze Familie eine Regel zu schreiben. Sie können auch jeden genauen Namen eingeben (z. B. “GPTBot“ oder “Baiduspider-image“); wenn die Site eine Gruppe dafür hat, gelten nur deren Regeln.

Lädt dieses Tool meine Seite? Woher kommt die robots.txt?

Es lädt nur die /robots.txt des Ziels — nie die Seite selbst — und zwar von einem Server dieser Website, weil Browser die robots.txt fremder Ursprünge nicht direkt lesen können (CORS). Der Abruf ist limitiert, auf 512 KB begrenzt, folgt höchstens 3 Weiterleitungen und lehnt private/reservierte Adressen ab. Die Datei wird vollständig in Ihrem Browser geparst; kein Konto nötig, Ihre URL wird nicht gespeichert.

Was der Checker prüft

Die robots.txt, wie Bots sie sehen

Abrufen, parsen und simulieren — jede Disallow-Regel wird gegen die eigenen URLs getestet, mit Urteil für jeden einzelnen Pfad.

🕸️

Echte Regeln, echtes Urteil

Lädt die tatsächliche robots.txt und bewertet sie exakt wie die Suchmaschinen: RFC-9309-Längstmuster, Allow vor Disallow, Präfix-User-Agent-Gruppen — niemals eine Schätzung.

⚖️

Die entscheidende Zeile wird gezeigt

Über die Erlaubt / Gesperrt-Plakette hinaus sehen Sie die konkrete Regel, die entschieden hat, und die User-Agent-Gruppe — verständlicher Grund, warum.

🆓

Kein Seitenladen, keine Anmeldung, gratis

Es wird nur die öffentliche robots.txt geholt (nie Ihre Seite), durch einen limitierten, auf 512 KB begrenzten Leser, der private Adressen ablehnt. Kein Konto, keine Credits.

Ähnliche Tools

Was ist eine robots.txt-Prüfung?

Eine robots.txt-Prüfung lädt die robots.txt einer Website und sagt Ihnen genau, was ein einzelner Crawler abrufen darf — bewertet genauso, wie es die großen Suchmaschinen tun. robots.txt ist eine kleine öffentliche Textdatei, mit der jede Website festlegen kann, welche Pfade Web-Crawler abrufen dürfen und welche nicht (“Disallow: /admin/“, “Allow: /public/“, gruppiert pro Crawler unter User-agent-Zeilen). Sie ist keine Sicherheitsgrenze, aber so werden Suchmaschinen und Bots über Ihre Crawling-Präferenzen informiert — und ein falsch geschriebene Regel ist eine der häufigsten Ursachen, dass eine Seite unabsichtlich vor Google versteckt wird. Dieses Tool liest die Datei und wendet die Regeln aus RFC 9309 an: längstes Muster gewinnt, Allow schlägt gleich langes Disallow, * passt auf beliebige Zeichen, abschließendes $ verankert das Ende, und eine Gruppe gilt für einen Crawler, wenn ihr Token ein nicht fallunterscheidender Präfix des Bot-Namens ist.

Was dieses Tool zeigt

  • Ein sofortiges Erlaubt / Gesperrt-Urteil für genau ein (Pfad, Crawler)-Paar
  • Die Regel, die entschieden hat, und die User-Agent-Gruppe, aus der sie stammt
  • Den HTTP-Status der robots.txt-Antwort (404 bedeutet: alles erlaubt)
  • Zählungen von Gruppen, passenden Regeln und gefundenen Sitemaps
  • Die rohe robots.txt zum Nachprüfen

Wann verwenden

  • Vor dem Launch eines Bereichs: sicherstellen, dass er für Googlebot erreichbar ist
  • Debuggen fehlender Seiten: prüfen, ob eine robots-Regel sie blockiert
  • Verifizieren, dass ein Allow-Override ein früheres Disallow wirklich überschreibt (häufiger Fehler)
  • Beim Hinzufügen neuer Bots (KI-Crawler, Bildbots): bestätigen, welche Pfade sie nutzen dürfen

Hinweis zum Datenschutz: Dieses Tool sendet die eingegebene URL an einen Server dieser Website, der nur die öffentliche robots.txt des Ziels lädt — Ihre Seite wird nie geladen. Die Datei wird in Ihrem Browser ausgewertet, Ergebnisse werden kurz zwischengespeichert, kein Konto nötig, nichts über Sie wird gespeichert.

Ähnliche Tools