TutusooBot
TutusooBot 爬虫政策
TutusooBot 为图图搜建立公开网页索引。它默认遵守 robots.txt,不访问私网地址,并限制单页响应大小和单任务抓取数量。
识别我们的爬虫
正式请求使用下面的 User-Agent。站点可以针对 TutusooBot 单独设置规则,也可以使用 User-agent: * 的通用规则。
TutusooBot/0.1 (+https://tutusoo.com/bot)允许或禁止抓取
使用标准 robots.txt 即可一步控制。规则变更会在后续重新抓取时生效;被禁止的历史页面会从索引清理。
User-agent: TutusooBot
Disallow: /private/
Crawl-delay: 5资源与访问礼貌
系统按站点间隔访问,读取站点声明的 Crawl-delay,并对异常大页面、重定向和 sitemap 做边界校验。
- 默认页面间隔为 1 秒。
- Crawl-delay 会被遵守,并设有防止任务永久占用的合理上限。
- 单页正文、sitemap 层级和单任务页面数均受限制。