TutusooBot

Politique du robot TutusooBot

TutusooBot construit l’index web public utilisé par TutuSoo. Il respecte robots.txt par défaut, refuse les cibles de réseau privé et limite la taille de réponse et les pages par tâche de crawl.

Identifier notre robot

Les requêtes de production utilisent le User-Agent ci-dessous. Les éditeurs peuvent cibler spécifiquement TutusooBot ou utiliser les règles communes User-agent: *.

TutusooBot/0.1 (+https://tutusoo.com/bot)

Autoriser ou bloquer le crawl

Une règle robots.txt standard suffit. Les changements prennent effet lors d’un recrawl ultérieur ; les pages déjà indexées devenues interdites sont supprimées.

User-agent: TutusooBot
Disallow: /private/
Crawl-delay: 5

Accès courtois et limites de ressources

Les requêtes sont espacées par site, les valeurs Crawl-delay déclarées sont lues, et les pages trop grandes, redirections et sitemaps sont bornés.

  • Le délai par défaut entre pages est d’une seconde.
  • Le Crawl-delay est respecté avec un plafond de sécurité contre les tâches occupées en permanence.
  • Le contenu par page, la profondeur du sitemap et les pages par tâche sont limités.