Se hvilke crawlere din robots.txt lukker ind
Indtast et websted. sus.bot henter dets robots.txt og viser, hvilke sider hver søgemaskine og AI-crawler må besøge. Den viser også de stier, filen afslører for alle, der læser den. Tjekket kører i din browser og er gratis.
Indsæt en robots.txt i stedet
Vurdering
Få besked, når en robots.txt ændres
Overvågning tjekker dine og dine konkurrenters websteder hver sjette time. Når en fil ændres, får du en besked i Slack, Discord eller Teams med de ændrede linjer og de berørte crawlere.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
Status for AI-scraping
Crawleradgang
Afgjort pr. crawler efter RFC 9309: den mest specifikke gruppe vinder, derefter den længste regel, og ved lighed vinder Allow.
Test en sti
Tjek enhver sti eller URL mod enhver user-agent.
Reel adgang pr. user-agent
Henter filen igen via proxyen med hver crawlers rigtige user-agent-streng. En anden status eller et andet indhold betyder, at serveren behandler den crawler anderledes (botblokering, WAF-regler, cloaking).
Problemer
Sikkerhedsnoter
Disallow-regler, der peger på steder, angribere kigger efter først. Dette tjekker, hvad filen afslører, ikke om stierne findes eller er beskyttet.
Rekognoscering
Hvad en fremmed lærer om dette websted alene ud fra filen: platformen, cloud-buckets, andre hostnavne, API-indgange, datafeeds, filtyper og noter i kommentarer. Intet her hentes eller afprøves; det læses direkte fra teksten.
Sitemaps
Filindhold
Kommandolinje og GitHub Action
Kør de samme tjek i din terminal eller i CI. Buildet kan fejle, når en regel ændres.
susbot audit https://example.com --fail-on warning
robots.txt-filer fra store websteder
Vi henter robots.txt fra 200 store websteder hver dag og gemmer hver version.
Browserudvidelse
Viser, om den side, du er på, må crawles. Den er ikke udgivet endnu.