Zistite, ktoré crawlery váš robots.txt púšťa dnu
Zadajte web. sus.bot stiahne jeho robots.txt a ukáže, ktoré stránky smie navštíviť každý vyhľadávač a každý AI crawler. Vypíše aj cesty, ktoré súbor prezrádza každému, kto si ho prečíta. Kontrola beží vo vašom prehliadači a je zadarmo.
Alebo vložte robots.txt
Verdikt
Dostaňte správu, keď sa robots.txt zmení
Sledovanie kontroluje vaše weby aj weby konkurencie každých šesť hodín. Keď sa súbor zmení, dostanete správu do Slacku, Discordu alebo Teams so zmenenými riadkami a dotknutými crawlermi.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
Stav AI scrapingu
Prístup robotov
Vyhodnotené pre každý crawler podľa RFC 9309: vyhráva najkonkrétnejšia skupina, potom najdlhšie pravidlo a pri zhode Allow.
Otestovať cestu
Overte ľubovoľnú cestu alebo URL pre ľubovoľný user-agent.
Skutočný prístup podľa user-agenta
Vyžiada súbor znova cez proxy so skutočným reťazcom user-agent každého robota. Iný stav alebo obsah znamená, že server s daným robotom zaobchádza inak (blokovanie botov, pravidlá WAF, cloaking).
Problémy
Bezpečnostné poznámky
Pravidlá Disallow ukazujúce na miesta, kam sa útočníci pozerajú ako prvé. Kontroluje sa, čo súbor prezrádza, nie či cesty existujú alebo sú chránené.
Prieskum
Čo sa cudzí človek dozvie o tejto stránke len zo súboru: platformu, cloudové buckety, iné hostname, vstupné body API, dátové feedy, typy súborov a poznámky v komentároch. Nič sa nesťahuje ani neskúša; všetko sa číta priamo z textu.
Sitemapy
Obsah súboru
Príkazový riadok a GitHub Action
Spustite rovnaké kontroly v termináli alebo v CI. Build môže zlyhať, keď sa zmení pravidlo.
susbot audit https://example.com --fail-on warning
Súbory robots.txt veľkých webov
Každý deň sťahujeme robots.txt 200 veľkých webov a uchovávame každú verziu.
Rozšírenie prehliadača
Ukazuje, či smie byť stránka, na ktorej ste, prehľadávaná. Zatiaľ nevyšlo.