Über den Crawler AiReadinessBot
Wenn Sie diese Adresse in Ihren Protokollen gefunden haben, ist diese Seite für Sie. Hier steht, wer wir sind, was wir abrufen, wie oft, und wie Sie uns aussperren.
Wer wir sind
Wir sind der Crawler eines Dienstes, der Websites prüft. Wir kommen aus einem von zwei Gründen: Der Betreiber hat eine Prüfung seiner Seite bestellt, oder jemand hat einen Bericht zu einer öffentlichen Adresse angefordert. Wir stellen uns so vor:
AiReadinessBot/1.0 (+https://ai-readiness.local/bot)Was wir abrufen
- die Startseite — zweimal: einmal als Crawler, einmal als Browser, um zu sehen, ob beide dasselbe bekommen
- robots.txt, sitemap.xml, llms.txt und das Seitensymbol
- bis zu 8 Unterseiten, die wir über Ihre eigenen Links gefunden haben
- bis zu 15 Links, um zu sehen, welche ins Leere führen
- bis zu 8 Bilder und bis zu 5 Adressen aus der Sitemap
- sechs bekannte Adressen, die nicht öffentlich sein sollten: .git/config, .env, phpinfo.php, backup.zip, dump.sql, database.sql
Wir lesen nur. Wir senden keine Formulare ab, melden uns nirgends an, ändern nichts und probieren kein Passwort. Jede Anfrage ist ein GET.
Wie oft
- Eine Prüfung sind höchstens etwa 60 Anfragen, meist weniger.
- Ihre Seite wird nicht öfter als 6-mal pro Stunde geprüft, egal wer fragt und von wie vielen Adressen. Wenn Sie ein Abonnement haben und uns um Überwachung gebeten haben, liegt die Grenze bei 30 — dann belasten Sie Ihren Server selbst, und zwar absichtlich.
- Eine überwachte Seite wird höchstens alle 20 Stunden erneut geprüft.
- Ein Besucher kann nicht mehr als 5 Prüfungen pro Minute und 30 pro Stunde starten.
- Eine wiederholte Anfrage innerhalb von 5 Minuten bekommt den fertigen Bericht statt eines neuen Besuchs auf Ihrem Server.
Wie Sie uns aussperren
Fügen Sie das in Ihre robots.txt ein:
User-agent: AiReadinessBot
Disallow: /Eine Regel, die uns beim Namen nennt, gilt für uns immer und ohne Ausnahme — wir lesen robots.txt vor jedem Besuch.
Eine Ausnahme, offen gesagt: Eine allgemeine Regel für alle Robots (User-agent: *) hält uns nicht auf einer Seite auf, deren Betreiber bei uns ein laufendes Abonnement hat und uns um Überwachung gebeten hat. Eine Regel mit dem Namen AiReadinessBot hält uns auch dort auf.
Wenn etwas schiefging
Die Adresse kommt zusammen mit der Domain. Bis dahin: Wenn unser Crawler Sie stört, stoppt ihn die obige robots.txt-Regel sofort.