TutusooBot

TutusooBot 爬虫政策

TutusooBot 为图图搜建立公开网页索引。它默认遵守 robots.txt,不访问私网地址,并限制单页响应大小和单任务抓取数量。

识别我们的爬虫

正式请求使用下面的 User-Agent。站点可以针对 TutusooBot 单独设置规则,也可以使用 User-agent: * 的通用规则。

TutusooBot/0.1 (+https://tutusoo.com/bot)

允许或禁止抓取

使用标准 robots.txt 即可一步控制。规则变更会在后续重新抓取时生效;被禁止的历史页面会从索引清理。

User-agent: TutusooBot
Disallow: /private/
Crawl-delay: 5

资源与访问礼貌

系统按站点间隔访问,读取站点声明的 Crawl-delay,并对异常大页面、重定向和 sitemap 做边界校验。

  • 默认页面间隔为 1 秒。
  • Crawl-delay 会被遵守,并设有防止任务永久占用的合理上限。
  • 单页正文、sitemap 层级和单任务页面数均受限制。