关于AI 爬虫访问检测
AI 公司抓取网页,一是训练模型,二是在回答问题时实时引用,AI 爬虫访问检测帮你查清哪些 AI 爬虫能访问你的网站。想禁止 AI 训练、发现 CDN 或插件替你加了 AI 规则、网站从没出现在 AI 搜索回答里时,都可以查一查。输入网站地址,点“开始检测”。
工具按 robots.txt 判断 25 个 AI 爬虫能否访问,包括 GPTBot、ClaudeBot、Google-Extended,以及 Perplexity、字节跳动、Meta、亚马逊、华为盘古等公司的爬虫。每个爬虫都标明用途(AI 训练、AI 搜索或替用户抓取)、放行还是禁止、起作用的规则,以及文件里有没有单独写它。还会查找 llms.txt 和 llms-full.txt,并检查首页的 noai 标记。屏蔽了 AI 搜索爬虫时会提醒你:网站可能从 AI 搜索的回答里消失。规则和 llms.txt 可以分别用 Robots.txt 生成器和 llms.txt 生成器来写。
AI 爬虫访问检测怎么用
- 1输入网站
填域名或网站上任意一个网址。
- 2点“开始检测”
读取 robots.txt、llms.txt、llms-full.txt 和首页。
- 3看结果表
每个 AI 爬虫的用途、是否放行和起作用的规则。
- 4决定并调整
可以只禁 AI 训练;想被 AI 搜索引用,就放行 AI 搜索爬虫。
为什么用熊仔工匠
- 25 个 AI 爬虫
OpenAI、Anthropic、谷歌、苹果、Perplexity、Meta、亚马逊、字节跳动等。
- 标明用途
AI 训练、AI 搜索、替用户抓取,分得清清楚楚。
- llms.txt 检查
查找 llms.txt 和 llms-full.txt,显示开头内容。
- noai 标记
检查 meta robots 和 X-Robots-Tag 里的 noai、noimageai。