Sobre o rastreador AiReadinessBot

Se encontrou este endereço nos seus registos, esta página é para si. Diz quem somos, o que pedimos, com que frequência e como fechar-nos a porta.

Quem somos

Somos o rastreador de um serviço de verificação de sites. Vimos por uma de duas razões: o dono pediu uma verificação do seu site, ou alguém pediu um relatório sobre um endereço público. Apresentamo-nos assim:

AiReadinessBot/1.0 (+https://ai-readiness.local/bot)

O que pedimos

  • a página inicial — duas vezes: como rastreador e como navegador, para ver se recebem a mesma coisa
  • robots.txt, sitemap.xml, llms.txt e o ícone do site
  • até 8 páginas internas encontradas nas suas próprias ligações
  • até 15 ligações, para ver quais estão partidas
  • até 8 imagens e até 5 endereços do mapa do site
  • seis endereços conhecidos que não deviam ser públicos: .git/config, .env, phpinfo.php, backup.zip, dump.sql, database.sql

Só lemos. Não submetemos formulários, não entramos em contas, não alteramos nada e não experimentamos palavras-passe. Cada pedido é um GET.

Com que frequência

  • Uma verificação são no máximo cerca de 60 pedidos, normalmente menos.
  • O seu site não é verificado mais de 6 vezes por hora, seja quem for a pedir e de quantos endereços for. Se subscreveu e nos pediu para o vigiar, o tecto é 30 — nessa altura quem carrega o seu servidor é o próprio, de propósito.
  • Um site em monitorização é reverificado no máximo uma vez a cada 20 horas.
  • Um visitante não pode lançar mais de 5 verificações por minuto e 30 por hora.
  • Um pedido repetido dentro de 5 minutos recebe o relatório já feito, não uma nova visita ao seu servidor.

Como fechar-nos a porta

Acrescente isto ao seu robots.txt:

User-agent: AiReadinessBot
Disallow: /

Uma regra que nos nomeia é lei para nós sempre, sem exceções — lemos o robots.txt antes de cada visita.

Uma exceção, dita com franqueza: uma regra geral para todos os robôs (User-agent: *) não nos trava num site cujo dono tem uma subscrição ativa connosco e nos pediu para o vigiar. Uma regra com o nome AiReadinessBot trava-nos também aí.

Se algo correu mal

O endereço aparecerá junto com o domínio. Até lá: se o nosso rastreador o incomoda, a regra de robots.txt acima trava-o de imediato.