AiReadinessBot क्रॉलर के बारे में

अगर यह पता आपको अपने लॉग में मिला है, तो यह पेज आपके लिए है। यहाँ लिखा है कि हम कौन हैं, क्या माँगते हैं, कितनी बार आते हैं और हमें कैसे रोका जाए।

हम कौन हैं

हम एक साइट-जाँच सेवा के क्रॉलर हैं। हम दो में से किसी एक वजह से आते हैं: मालिक ने अपनी साइट की जाँच माँगी, या किसी ने किसी सार्वजनिक पते की रिपोर्ट माँगी। हम इस तरह अपना परिचय देते हैं:

AiReadinessBot/1.0 (+https://ai-readiness.local/bot)

हम क्या माँगते हैं

  • मुख्य पेज — दो बार: एक बार क्रॉलर बनकर, एक बार ब्राउज़र बनकर, यह देखने कि दोनों को एक ही चीज़ मिलती है या नहीं
  • robots.txt, sitemap.xml, llms.txt और साइट का आइकन
  • आपकी ही कड़ियों से मिले अधिकतम 8 भीतरी पेज
  • अधिकतम 15 कड़ियाँ — यह देखने कि कौन-सी टूटी हैं
  • अधिकतम 8 तस्वीरें और साइटमैप से अधिकतम 5 पते
  • छह जाने-माने पते जो सार्वजनिक नहीं होने चाहिए: .git/config, .env, phpinfo.php, backup.zip, dump.sql, database.sql

हम सिर्फ़ पढ़ते हैं। फ़ॉर्म नहीं भेजते, लॉगिन नहीं करते, कुछ बदलते नहीं और कोई पासवर्ड नहीं आज़माते। हर अनुरोध GET है।

कितनी बार

  • एक जाँच में ज़्यादा से ज़्यादा क़रीब 60 अनुरोध, आमतौर पर उससे कम।
  • आपकी साइट घंटे में 6 बार से ज़्यादा नहीं जाँची जाती, चाहे कोई भी और कितने भी पतों से माँगे। अगर आपने सदस्यता ली है और निगरानी माँगी है, तो सीमा 30 है — तब अपने सर्वर पर बोझ आप ख़ुद, अपनी मर्ज़ी से डालते हैं।
  • निगरानी में रखी साइट 20 घंटे में एक बार से ज़्यादा नहीं जाँची जाती।
  • एक आगंतुक एक मिनट में 5 और एक घंटे में 30 से ज़्यादा जाँच शुरू नहीं कर सकता।
  • 5 मिनट के भीतर दोबारा माँगने पर तैयार रिपोर्ट मिलती है, आपके सर्वर पर नया चक्कर नहीं।

हमें कैसे रोकें

अपनी robots.txt में यह जोड़ें:

User-agent: AiReadinessBot
Disallow: /

जो नियम हमारा नाम लेता है, वह हमारे लिए हमेशा क़ानून है, बिना किसी अपवाद के — हर चक्कर से पहले हम robots.txt पढ़ते हैं।

एक बात साफ़-साफ़: सभी रोबोट के लिए बना आम नियम (User-agent: *) उन साइटों पर हमें नहीं रोकता जिनके मालिक ने हमारे यहाँ सदस्यता ली है और निगरानी माँगी है। AiReadinessBot नाम वाला नियम वहाँ भी रोक देता है।

अगर कुछ ग़लत हुआ

पता डोमेन के साथ ही आएगा। तब तक: अगर हमारा क्रॉलर परेशान कर रहा है, ऊपर वाला robots.txt नियम उसे तुरंत रोक देता है।