Sobre o rastreador AiReadinessBot
Se encontrou este endereço nos seus registos, esta página é para si. Diz quem somos, o que pedimos, com que frequência e como fechar-nos a porta.
Quem somos
Somos o rastreador de um serviço de verificação de sites. Vimos por uma de duas razões: o dono pediu uma verificação do seu site, ou alguém pediu um relatório sobre um endereço público. Apresentamo-nos assim:
AiReadinessBot/1.0 (+https://ai-readiness.local/bot)O que pedimos
- a página inicial — duas vezes: como rastreador e como navegador, para ver se recebem a mesma coisa
- robots.txt, sitemap.xml, llms.txt e o ícone do site
- até 8 páginas internas encontradas nas suas próprias ligações
- até 15 ligações, para ver quais estão partidas
- até 8 imagens e até 5 endereços do mapa do site
- seis endereços conhecidos que não deviam ser públicos: .git/config, .env, phpinfo.php, backup.zip, dump.sql, database.sql
Só lemos. Não submetemos formulários, não entramos em contas, não alteramos nada e não experimentamos palavras-passe. Cada pedido é um GET.
Com que frequência
- Uma verificação são no máximo cerca de 60 pedidos, normalmente menos.
- O seu site não é verificado mais de 6 vezes por hora, seja quem for a pedir e de quantos endereços for. Se subscreveu e nos pediu para o vigiar, o tecto é 30 — nessa altura quem carrega o seu servidor é o próprio, de propósito.
- Um site em monitorização é reverificado no máximo uma vez a cada 20 horas.
- Um visitante não pode lançar mais de 5 verificações por minuto e 30 por hora.
- Um pedido repetido dentro de 5 minutos recebe o relatório já feito, não uma nova visita ao seu servidor.
Como fechar-nos a porta
Acrescente isto ao seu robots.txt:
User-agent: AiReadinessBot
Disallow: /Uma regra que nos nomeia é lei para nós sempre, sem exceções — lemos o robots.txt antes de cada visita.
Uma exceção, dita com franqueza: uma regra geral para todos os robôs (User-agent: *) não nos trava num site cujo dono tem uma subscrição ativa connosco e nos pediu para o vigiar. Uma regra com o nome AiReadinessBot trava-nos também aí.
Se algo correu mal
O endereço aparecerá junto com o domínio. Até lá: se o nosso rastreador o incomoda, a regra de robots.txt acima trava-o de imediato.