免费注册

AI 爬虫访问检测

看看你的 robots.txt 放行了哪些 AI 爬虫,以及网站有没有 llms.txt。

关于AI 爬虫访问检测

AI 公司抓取网页,一是训练模型,二是在回答问题时实时引用,AI 爬虫访问检测帮你查清哪些 AI 爬虫能访问你的网站。想禁止 AI 训练、发现 CDN 或插件替你加了 AI 规则、网站从没出现在 AI 搜索回答里时,都可以查一查。输入网站地址,点“开始检测”。

工具按 robots.txt 判断 25 个 AI 爬虫能否访问,包括 GPTBot、ClaudeBot、Google-Extended,以及 Perplexity、字节跳动、Meta、亚马逊、华为盘古等公司的爬虫。每个爬虫都标明用途(AI 训练、AI 搜索或替用户抓取)、放行还是禁止、起作用的规则,以及文件里有没有单独写它。还会查找 llms.txt 和 llms-full.txt,并检查首页的 noai 标记。屏蔽了 AI 搜索爬虫时会提醒你:网站可能从 AI 搜索的回答里消失。规则和 llms.txt 可以分别用 Robots.txt 生成器和 llms.txt 生成器来写。

AI 爬虫访问检测怎么用

  1. 1
    输入网站

    填域名或网站上任意一个网址。

  2. 2
    点“开始检测”

    读取 robots.txt、llms.txt、llms-full.txt 和首页。

  3. 3
    看结果表

    每个 AI 爬虫的用途、是否放行和起作用的规则。

  4. 4
    决定并调整

    可以只禁 AI 训练;想被 AI 搜索引用,就放行 AI 搜索爬虫。

为什么用熊仔工匠

  • 25 个 AI 爬虫

    OpenAI、Anthropic、谷歌、苹果、Perplexity、Meta、亚马逊、字节跳动等。

  • 标明用途

    AI 训练、AI 搜索、替用户抓取,分得清清楚楚。

  • llms.txt 检查

    查找 llms.txt 和 llms-full.txt,显示开头内容。

  • noai 标记

    检查 meta robots 和 X-Robots-Tag 里的 noai、noimageai。

常见问题

AI 爬虫访问检测常见问题

AI 训练爬虫和 AI 搜索爬虫有什么区别?
GPTBot、CCBot 这类训练爬虫收集网页来训练模型;OAI-SearchBot、PerplexityBot 这类 AI 搜索爬虫抓取网页,在回答里引用。两类可以分开设置,比如禁止训练、允许搜索。
屏蔽 Google-Extended 会影响谷歌搜索排名吗?
不会。它只决定谷歌能否把你的内容用于 Gemini 等 AI 模型,谷歌搜索的抓取和排名不受影响。
llms.txt 是什么?
放在网站根目录 /llms.txt 的 Markdown 文件,用简短的介绍和重点链接告诉 AI 助手你的网站是做什么的。它是一种提议中的做法,不是正式标准,但已有 AI 工具会读取。
AI 爬虫会遵守 robots.txt 吗?
GPTBot、ClaudeBot、PerplexityBot 等主流爬虫都声明会遵守。但 robots.txt 只是约定,不是锁,真正拦住只能靠服务器或防火墙。按 IP 屏蔽前,先用百度真假蜘蛛识别核对一下,别误伤真蜘蛛。
AI 爬虫访问检测收费吗?
免费,不占每日次数。文件在你点击时抓取,结果不保存。
把AI 爬虫访问检测分享给朋友打开浏览器就能用,对方不注册也能先试。

相关工具

SEO 死链检测检查一个网页上的全部链接,列出失效和跳转的链接。
SEO 网站 SEO 检测一次检查 40 多项页面和技术 SEO,每个问题都给出改法。
SEO 网页可收录检测一次查清网页能不能被收录:状态码、robots、noindex 和 canonical。
SEO 关键词密度检测统计网页或文章里出现最多的词和短语,以及各自的占比。
SEO Meta 标签检测查看网页的标题、描述、robots、canonical 和分享标签,并检查长度。
SEO Robots.txt 检测读取网站的 robots.txt,测试某个网址对各个爬虫是否放行。
SEO 搜索引擎蜘蛛模拟抓取以百度蜘蛛、谷歌机器人的身份抓取网页,看它们看到的内容和普通访客是否一样。
TXT 广告法违禁词检测标出文案里违反《广告法》的极限词和违禁用语。