AI 爬虫检查器

检查网站是否利于 ChatGPT、Claude、Perplexity 理解

🌐 工具会直接向您输入的网站请求 robots.txt 与 llms.txt。

此工具会读取 /robots.txt 与 /llms.txt;若网站阻挡浏览器跨站读取,会通过 api.allorigins.win 重试。

快速理解

AI 爬虫检查器可以怎么帮你?

免费 AI 爬虫检查工具,检查 GPTBot、ClaudeBot、PerplexityBot、Googlebot 与 llms.txt 设置。

适合场景

适合初步检查公开网站根目录的 robots.txt 与 llms.txt 是否可读取,并查看七个内置爬虫名称对应的根路径规则。它不访问全站页面,也不能证明这些爬虫已经抓取、收录或使用网站内容。

使用方式

输入网址并开始检查,缺少协议时补 https;输入中的页面路径会被去掉,只请求该来源的两个根目录文件。请求附带时间参数,直接读取失败后会再经公开代理尝试获取内容。

结果怎么看

found 主要表示请求成功,llms.txt 还要求非空,但不验证文件格式。allowed 或 blocked 只依据根路径 / 的简化匹配;优先同名 User-agent,否则用 *。robots 获取失败时,各爬虫显示 unknown。

隐私与限制

浏览器会请求目标网站,失败后可能将文件 URL 发送给 api.allorigins.win 代理。双方都可能收到网络连接信息;不要用它检查内部系统、含用户名密码的地址,或不适合向第三方透露的网站来源。

规则解析不完整支持路径通配符与结尾匹配,不检查逐页访问、服务器防护或爬虫实际行为。返回 HTML 错误页的成功响应也可能显示 found;有疑问时直接查看原始文件,别把结果当成全站通行结论。

常见问题

为什么有些网站检查失败?

部分网站会用 CORS 阻挡浏览器读取 robots.txt。

GEO 是什么?

GEO 是让 AI 回答引擎更容易理解与引用网站内容的优化方式。