TutusooBot

TutusooBot-Crawler-Richtlinie

TutusooBot erstellt den von TutuSoo genutzten öffentlichen Web-Index. Er beachtet robots.txt standardmäßig, lehnt Ziele im privaten Netz ab und begrenzt Antwortgröße und Seiten pro Crawl-Aufgabe.

Unseren Crawler erkennen

Produktionsanfragen verwenden den User-Agent unten. Publisher können gezielt TutusooBot ansprechen oder die üblichen User-agent: *-Regeln nutzen.

TutusooBot/0.1 (+https://tutusoo.com/bot)

Crawling erlauben oder blockieren

Eine Standard-robots.txt-Regel genügt. Änderungen wirken bei einem späteren Recrawl; zuvor indexierte, nun verbotene Seiten werden entfernt.

User-agent: TutusooBot
Disallow: /private/
Crawl-delay: 5

Höflicher Zugriff und Ressourcenlimits

Anfragen werden pro Website getaktet, deklarierte Crawl-delay-Werte gelesen und übergroße Seiten, Weiterleitungen und Sitemaps begrenzt.

  • Die Standardverzögerung zwischen Seiten beträgt eine Sekunde.
  • Crawl-delay wird mit einer Sicherheitsobergrenze gegen dauerhaft belegte Jobs beachtet.
  • Inhalt pro Seite, Sitemap-Tiefe und Seiten pro Aufgabe sind begrenzt.