TutusooBot
TutusooBot-Crawler-Richtlinie
TutusooBot erstellt den von TutuSoo genutzten öffentlichen Web-Index. Er beachtet robots.txt standardmäßig, lehnt Ziele im privaten Netz ab und begrenzt Antwortgröße und Seiten pro Crawl-Aufgabe.
Unseren Crawler erkennen
Produktionsanfragen verwenden den User-Agent unten. Publisher können gezielt TutusooBot ansprechen oder die üblichen User-agent: *-Regeln nutzen.
TutusooBot/0.1 (+https://tutusoo.com/bot)Crawling erlauben oder blockieren
Eine Standard-robots.txt-Regel genügt. Änderungen wirken bei einem späteren Recrawl; zuvor indexierte, nun verbotene Seiten werden entfernt.
User-agent: TutusooBot
Disallow: /private/
Crawl-delay: 5Höflicher Zugriff und Ressourcenlimits
Anfragen werden pro Website getaktet, deklarierte Crawl-delay-Werte gelesen und übergroße Seiten, Weiterleitungen und Sitemaps begrenzt.
- Die Standardverzögerung zwischen Seiten beträgt eine Sekunde.
- Crawl-delay wird mit einer Sicherheitsobergrenze gegen dauerhaft belegte Jobs beachtet.
- Inhalt pro Seite, Sitemap-Tiefe und Seiten pro Aufgabe sind begrenzt.