Iċċekkja liema crawlers iħalli jidħlu r-robots.txt tiegħek
Daħħal sit web. sus.bot iġib ir-robots.txt tiegħu u juri liema paġni jista' jżur kull magna tat-tfittxija u kull crawler tal-AI. Jelenka wkoll il-mogħdijiet li l-fajl jiżvela lil kull min jaqrah. Il-verifika ssir fil-browser tiegħek u hija b'xejn.
Jew waħħal robots.txt
Verdett
Irċievi messaġġ meta robots.txt jinbidel
Il-monitoraġġ jiċċekkja s-siti tiegħek u tal-kompetituri kull sitt sigħat. Meta fajl jinbidel, tirċievi messaġġ f'Slack, Discord jew Teams bil-linji li nbidlu u l-crawlers affettwati.
- Allow: /pricing/compare + Disallow: /pricing/compare + User-agent: GPTBot + Disallow: /
Status tal-iscraping tal-IA
Aċċess tal-crawlers
Solvut għal kull crawler bl-RFC 9309: jirbaħ l-iktar grupp speċifiku, imbagħad l-itwal regola, u f'każ ta' ugwaljanza Allow.
Ittestja mogħdija
Iċċekkja kwalunkwe mogħdija jew URL ma' kwalunkwe user-agent.
Aċċess reali skont il-user-agent
Jitlob il-fajl mill-ġdid permezz tal-proxy bl-istringa user-agent vera ta' kull crawler. Status jew kontenut differenti jfisser li s-server jittratta dak il-crawler b'mod differenti (imblukkar ta' bots, regoli WAF, cloaking).
Problemi
Noti ta' sigurtà
Regoli Disallow li jindikaw postijiet fejn l-attakkanti jħarsu l-ewwel. Dan jiċċekkja x'jikxef il-fajl, mhux jekk il-mogħdijiet jeżistux jew humiex protetti.
Rikonoxximent
X'jitgħallem barrani dwar dan is-sit mill-fajl biss: il-pjattaforma, buckets fil-cloud, hostnames oħra, punti ta' dħul tal-API, feeds tad-data, tipi ta' fajls, u noti mħollija fil-kummenti. Xejn hawn ma jitniżżel jew jiġi ttestjat; jinqara direttament mit-test.
Sitemaps
Kontenut tal-fajl
Linja tal-kmand u GitHub Action
Ħaddem l-istess verifiki fit-terminal jew fis-CI. Il-build jista' jfalli meta tinbidel regola.
susbot audit https://example.com --fail-on warning
Fajls robots.txt ta' siti kbar
Kuljum niġbru r-robots.txt ta' 200 sit kbir u nżommu kull verżjoni.
Estensjoni tal-browser
Juri jekk il-paġna li qiegħed fiha tistax tiġi crawled. Għadu ma ħariġx.