robots.txt में AI क्रॉलरों की पहुँच गंभीर
देखते हैं कि साइट ने GPTBot, ClaudeBot, PerplexityBot और Google-Extended को रोका तो नहीं।
ChatGPT, Claude और Perplexity साइटें Google से अलग तरह पढ़ते हैं। हम आपकी साइट 16 तकनीकी बिंदुओं पर जाँचेंगे और बताएँगे कि AI आपका हवाला क्यों नहीं देता।
जाँच में 1–3 मिनट लगते हैं: हम पेज और उससे जुड़ी सभी चीज़ें देखते हैं।
देखते हैं कि साइट ने GPTBot, ClaudeBot, PerplexityBot और Google-Extended को रोका तो नहीं।
मूल HTML में पाठ खोजते हैं: AI क्रॉलर स्क्रिप्ट नहीं चलाते।
पेज को ब्राउज़र बनकर और AI क्रॉलर बनकर माँगते हैं और दोनों उत्तरों की तुलना करते हैं।
देखते हैं कि /llms.txt है या नहीं — साइट का छोटा नक्शा, जिसे भाषा मॉडल पढ़ते हैं।
देखते हैं कि मुख्य पेज 200 देता है और रीडायरेक्ट की शृंखला के पीछे छिपा नहीं है।
देखते हैं कि HTTPS चलता है, प्रमाणपत्र वैध है और http उसी पर भेजता है।
वह संरचित डेटा खोजते हैं जिससे AI सामग्री का प्रकार और लेखक पहचानता है।
title, description, canonical, lang और Open Graph देखते हैं।
देखते हैं कि H1 एक ही है, शीर्षकों का क्रम सही है, और main/article/header टैग मौजूद हैं।
पाठ की मात्रा, अद्यतन की तारीख और लेखक के नाम की मौजूदगी तौलते हैं।
पेज में मार्कअप की तुलना में असली टेक्स्ट कितना है — पतले पेज AI के लिए पढ़ना कठिन।
ईमेल, फ़ोन या पता दिखता है या नहीं — "कैसे संपर्क करें" का उत्तर AI पेज की सामग्री से देता है।
आधिकारिक सोशल खातों के लिंक साइट को AI की जानी-पहचानी इकाई से जोड़ते हैं।
alt के बिना तस्वीरों का अनुपात गिनते हैं — इसके बिना न AI जानता है और न स्क्रीन रीडर कि तस्वीर में क्या है।
देखते हैं कि साइटमैप है, खुलता है और robots.txt में दर्ज है।
उत्तर का समय, HTML का आकार और संपीड़न चालू है या नहीं, मापते हैं।