关于 AiReadinessBot 爬虫
如果你在日志里看到了这个地址,这个页面就是为你写的。这里说明我们是谁、请求什么、多久来一次,以及怎样把我们挡在门外。
我们是谁
我们是一个网站检查服务的爬虫。来访只有两种原因:站长请我们检查他的网站,或者有人请求了一份关于某个公开地址的报告。我们这样自我介绍:
AiReadinessBot/1.0 (+https://ai-readiness.local/bot)我们请求什么
- 首页——请求两次:一次以爬虫身份,一次以浏览器身份,看两者拿到的是否一样
- robots.txt、sitemap.xml、llms.txt 和网站图标
- 最多 8 个内页,都是顺着你自己的链接找到的
- 最多 15 个链接,看看哪些已经失效
- 最多 8 张图片,以及站点地图里最多 5 个地址
- 六个众所周知、本不该公开的地址:.git/config、.env、phpinfo.php、backup.zip、dump.sql、database.sql
我们只读取。不提交表单,不登录,不修改任何东西,也不尝试任何密码。每个请求都是 GET。
多久来一次
- 一次检查最多约 60 个请求,通常更少。
- 无论谁请求、从多少个地址请求,你的网站每小时最多被检查 6 次。如果你已订阅并要求我们持续监测,上限是 30——那时给你自己服务器施加负载的是你本人,而且是有意为之。
- 处于监测中的网站,每 20 小时最多重新检查一次。
- 同一位访客每分钟最多发起 5 次检查,每小时最多 30 次。
- 5 分钟内的重复请求会拿到已有报告,而不是再次访问你的服务器。
怎样把我们挡在门外
在 robots.txt 里加上:
User-agent: AiReadinessBot
Disallow: /点名我们的规则对我们永远有效,没有例外——每次来访前我们都会读 robots.txt。
有一条如实说明的例外:面向所有机器人的通用规则(User-agent: *)拦不住我们访问那些站长已在我们这里订阅、并要求我们持续监测的网站。写明 AiReadinessBot 的规则在那里同样能拦住我们。
如果出了问题
这个地址会随域名一起公布。在那之前:如果我们的爬虫给你添了麻烦,上面那条 robots.txt 规则可以立即拦住它。