关于 AiReadinessBot 爬虫

如果你在日志里看到了这个地址,这个页面就是为你写的。这里说明我们是谁、请求什么、多久来一次,以及怎样把我们挡在门外。

我们是谁

我们是一个网站检查服务的爬虫。来访只有两种原因:站长请我们检查他的网站,或者有人请求了一份关于某个公开地址的报告。我们这样自我介绍:

AiReadinessBot/1.0 (+https://ai-readiness.local/bot)

我们请求什么

  • 首页——请求两次:一次以爬虫身份,一次以浏览器身份,看两者拿到的是否一样
  • robots.txt、sitemap.xml、llms.txt 和网站图标
  • 最多 8 个内页,都是顺着你自己的链接找到的
  • 最多 15 个链接,看看哪些已经失效
  • 最多 8 张图片,以及站点地图里最多 5 个地址
  • 六个众所周知、本不该公开的地址:.git/config、.env、phpinfo.php、backup.zip、dump.sql、database.sql

我们只读取。不提交表单,不登录,不修改任何东西,也不尝试任何密码。每个请求都是 GET。

多久来一次

  • 一次检查最多约 60 个请求,通常更少。
  • 无论谁请求、从多少个地址请求,你的网站每小时最多被检查 6 次。如果你已订阅并要求我们持续监测,上限是 30——那时给你自己服务器施加负载的是你本人,而且是有意为之。
  • 处于监测中的网站,每 20 小时最多重新检查一次。
  • 同一位访客每分钟最多发起 5 次检查,每小时最多 30 次。
  • 5 分钟内的重复请求会拿到已有报告,而不是再次访问你的服务器。

怎样把我们挡在门外

在 robots.txt 里加上:

User-agent: AiReadinessBot
Disallow: /

点名我们的规则对我们永远有效,没有例外——每次来访前我们都会读 robots.txt。

有一条如实说明的例外:面向所有机器人的通用规则(User-agent: *)拦不住我们访问那些站长已在我们这里订阅、并要求我们持续监测的网站。写明 AiReadinessBot 的规则在那里同样能拦住我们。

如果出了问题

这个地址会随域名一起公布。在那之前:如果我们的爬虫给你添了麻烦,上面那条 robots.txt 规则可以立即拦住它。