Controleer welke crawlers je robots.txt binnenlaat
Voer een website in. sus.bot haalt de robots.txt op en laat zien welke pagina's elke zoekmachine en elke AI-crawler mag bezoeken. Het toont ook de paden die het bestand prijsgeeft aan iedereen die het leest. De controle draait in je browser en is gratis.
Of plak een robots.txt
Oordeel
Krijg een bericht als een robots.txt verandert
Monitoring controleert je eigen sites en die van concurrenten elke zes uur. Als een bestand verandert, krijg je een bericht in Slack, Discord of Teams met de gewijzigde regels en de crawlers die het raakt.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
AI-scrapingstatus
Toegang voor crawlers
Per crawler bepaald volgens RFC 9309: de meest specifieke groep wint, dan de langste regel, en bij gelijkspel Allow.
Een pad testen
Controleer elk pad of elke URL voor elke user-agent.
Werkelijke toegang per user-agent
Vraag het bestand opnieuw op via de proxy met de echte user-agentstring van elke crawler. Een andere status of inhoud betekent dat de server die crawler anders behandelt (botblokkering, WAF-regels, cloaking).
Problemen
Beveiligingsnotities
Disallow-regels die wijzen naar plekken waar aanvallers als eerste kijken. Dit controleert wat het bestand prijsgeeft, niet of de paden bestaan of beveiligd zijn.
Verkenning
Wat een vreemde alleen uit het bestand over deze site leert: het platform, cloudbuckets, andere hostnamen, API-ingangen, datafeeds, bestandstypen en notities in opmerkingen. Niets hiervan wordt opgehaald of afgetast; alles wordt rechtstreeks uit de tekst gelezen.
Sitemaps
Bestandsinhoud
Opdrachtregel en GitHub Action
Voer dezelfde controles uit in je terminal of in CI. De build kan falen als een regel verandert.
susbot audit https://example.com --fail-on warning
robots.txt-bestanden van grote sites
We halen elke dag de robots.txt van 200 grote sites op en bewaren elke versie.
Browserextensie
Laat zien of de pagina waarop je bent gecrawld mag worden. Nog niet uitgebracht.