Zjistěte, které crawlery váš robots.txt pouští dovnitř
Zadejte web. sus.bot stáhne jeho robots.txt a ukáže, které stránky smí navštívit jednotlivé vyhledávače a AI crawlery. Vypíše také cesty, které soubor prozrazuje každému, kdo si ho přečte. Kontrola běží ve vašem prohlížeči a je zdarma.
Nebo vložte robots.txt
Verdikt
Dostaňte zprávu, když se robots.txt změní
Sledování kontroluje vaše weby i weby konkurence každých šest hodin. Když se soubor změní, dostanete zprávu do Slacku, Discordu nebo Teams se změněnými řádky a dotčenými crawlery.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
Stav AI scrapingu
Přístup robotů
Vyhodnoceno pro každý crawler podle RFC 9309: vyhrává nejkonkrétnější skupina, pak nejdelší pravidlo a při shodě Allow.
Otestovat cestu
Ověřte libovolnou cestu nebo URL pro libovolný user-agent.
Skutečný přístup podle user-agenta
Vyžádá soubor znovu přes proxy se skutečným řetězcem user-agent každého robota. Jiný stav nebo obsah znamená, že server s daným robotem zachází jinak (blokování botů, pravidla WAF, cloaking).
Problémy
Bezpečnostní poznámky
Pravidla Disallow ukazující na místa, kam se útočníci dívají nejdřív. Kontroluje se, co soubor prozrazuje, ne zda cesty existují nebo jsou chráněné.
Průzkum
Co se cizí člověk dozví o tomto webu jen ze souboru: platforma, cloudové buckety, jiné hostname, vstupní body API, datové feedy, typy souborů a poznámky v komentářích. Nic se nestahuje ani nezkouší; vše se čte přímo z textu.
Sitemapy
Obsah souboru
Příkazová řádka a GitHub Action
Spusťte stejné kontroly v terminálu nebo v CI. Build může selhat, když se změní pravidlo.
susbot audit https://example.com --fail-on warning
Soubory robots.txt velkých webů
Každý den stahujeme robots.txt 200 velkých webů a uchováváme každou verzi.
Rozšíření prohlížeče
Ukazuje, zda smí být stránka, na které jste, procházena. Zatím nevyšlo.