robots.txt 中 AI 爬虫的访问权限 严重
查看网站是否屏蔽了 GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended。
ChatGPT、Claude 和 Perplexity 读取网站的方式和 Google 不同。我们从 16 个技术要点检查你的网站,指出是什么让 AI 无法引用你。
检测需要 1–3 分钟:我们会抓取页面及其依赖的资源。
查看网站是否屏蔽了 GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended。
在原始 HTML 中查找正文:AI 爬虫不执行脚本。
分别以浏览器和 AI 爬虫的身份请求页面,并比较两次响应。
检查是否有 /llms.txt —— 供语言模型阅读的简明站点说明。
检查首页是否返回 200,是否藏在一连串跳转之后。
检查 HTTPS 是否可用、证书是否有效、http 是否跳转到它。
查找结构化数据 —— AI 借此判断内容的类型和作者。
检查 title、description、canonical、lang 和 Open Graph。
检查是否只有一个 H1、标题层级是否合理,以及 main/article/header 标签。
衡量正文篇幅,以及是否标注了更新日期和作者。
页面中真正的文本相对标记有多少——内容稀薄的页面 AI 难以读取。
是否显示邮箱、电话或地址——AI 回答"如何联系"时依据页面上的内容。
指向官方社交账号的链接把网站与 AI 已知的实体关联起来。
统计缺少 alt 属性的图片比例 —— 没有它,AI 和读屏软件都不知道图里是什么。
检查站点地图是否存在、能否打开,以及是否写进了 robots.txt。
测量响应时间、HTML 大小,以及是否开启了压缩。