Prüfen Sie, welche Crawler Ihre robots.txt hereinlässt
Geben Sie eine Website ein. sus.bot lädt ihre robots.txt und zeigt, welche Seiten jede Suchmaschine und jeder KI-Crawler besuchen darf. Außerdem listet es die Pfade auf, die die Datei allen Lesern verrät. Die Prüfung läuft in Ihrem Browser und ist kostenlos.
Stattdessen eine robots.txt einfügen
Urteil
Erhalten Sie eine Nachricht, wenn sich eine robots.txt ändert
Die Überwachung prüft Ihre Websites und die Ihrer Konkurrenz alle sechs Stunden. Ändert sich eine Datei, erhalten Sie eine Nachricht in Slack, Discord oder Teams mit den geänderten Zeilen und den betroffenen Crawlern.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
KI-Scraping-Status
Crawler-Zugriff
Pro Crawler nach RFC 9309 aufgelöst: Die spezifischste Gruppe gewinnt, dann die längste Regel, bei Gleichstand Allow.
Einen Pfad testen
Prüfen Sie beliebige Pfade oder URLs für beliebige User-Agents.
Tatsächlicher Zugriff je User-Agent
Fordert die Datei erneut über den Proxy an, mit dem echten User-Agent-String jedes Crawlers. Ein anderer Status oder Inhalt bedeutet, dass der Server diesen Crawler anders behandelt (Bot-Blocking, WAF-Regeln, Cloaking).
Probleme
Sicherheitshinweise
Disallow-Regeln, die auf Orte zeigen, an denen Angreifer zuerst suchen. Geprüft wird, was die Datei verrät, nicht, ob die Pfade existieren oder geschützt sind.
Aufklärung
Was ein Fremder allein aus der Datei über diese Website erfährt: die Plattform, Cloud-Buckets, andere Hostnamen, API-Einstiegspunkte, Datenfeeds, Dateitypen und Notizen in Kommentaren. Nichts davon wird abgerufen oder angefragt; alles wird direkt aus dem Text gelesen.
Sitemaps
Dateiinhalt
Kommandozeile und GitHub Action
Führen Sie dieselben Prüfungen im Terminal oder in der CI aus. Der Build kann fehlschlagen, wenn sich eine Regel ändert.
susbot audit https://example.com --fail-on warning
robots.txt-Dateien großer Websites
Wir laden die robots.txt von 200 großen Websites täglich und bewahren jede Version auf.
Browser-Erweiterung
Zeigt, ob die aktuelle Seite gecrawlt werden darf. Noch nicht veröffentlicht.