免费注册

Robots.txt 检测

测试一个网址对 20 个搜索引擎和 AI 爬虫是否放行,找出起作用的那条规则。

关于Robots.txt 检测

robots.txt 写错一行,整站都可能从搜索结果里消失,所以要做 robots.txt 检测。上传新规则前、页面从百度或谷歌掉出去时、想知道 AI 爬虫能否抓你的内容时,都可以测一测。输入完整的页面网址,点开始测试;默认读取线上的 robots.txt,也可以粘贴草稿先试。

规则按谷歌的做法和 RFC 9309 解析:支持 * 通配符和 $ 结尾,最长的匹配规则生效,一样长时 Allow 优先,并选用最具体的 user-agent 分组。路径会对 20 个爬虫逐一测试,包括百度蜘蛛、谷歌蜘蛛、必应、360、搜狗、神马和 GPTBot 等 AI 爬虫,也可以加自定义爬虫。每一行显示放行还是禁止和起作用的规则,文件里对应的行会高亮。全站 Disallow: /、屏蔽 CSS 或 JS、语法错误、缺少 Sitemap 行、Crawl-delay、文件超过 500 KB 或返回错误状态码,都会提醒。新规则可以用 Robots.txt 生成器生成。

Robots.txt 检测怎么用

  1. 1
    输入页面网址

    填要测试的完整网址,而不只是域名。

  2. 2
    加爬虫或草稿

    可以填自定义爬虫名称,或粘贴规则草稿代替线上文件。

  3. 3
    点“开始测试”

    每个爬虫都得到放行或禁止的结论。

  4. 4
    看起作用的行

    在文件视图里找到高亮的规则,按需修改。

为什么用熊仔工匠

  • 按谷歌规则判断

    通配符、$ 结尾、最长匹配、Allow 优先,遵循 RFC 9309。

  • 20 个爬虫一起测

    百度、谷歌、360、搜狗、神马等搜索引擎,加上主流 AI 爬虫。

  • 上线前测草稿

    粘贴规则先测试,确认无误再上传。

  • 常见错误提醒

    全站屏蔽、屏蔽 CSS/JS、语法错误、缺少 Sitemap 行。

常见问题

Robots.txt 检测常见问题

robots.txt 里 Disallow 了,页面就不会被收录吗?
不一定。Disallow 只是不让抓取,如果别的页面链向它,这个网址仍可能被收录,只是没有内容摘要。想让页面不出现在搜索结果里,应允许抓取并加 noindex。改好后,可以用网页可收录检测分别确认百度和谷歌的结论。
谷歌支持 Crawl-delay 吗?
不支持,谷歌会忽略这一行,所以工具会提示。百度的抓取频次可以在百度搜索资源平台里调整。
robots.txt 返回 404 或 500 会怎样?
404 等 4xx 表示没有规则,蜘蛛可以抓取全部内容;5xx 服务器错误会让谷歌暂时把整站当作禁止抓取,所以工具会报警。
能在上传前测试 robots.txt 吗?
能。展开“测试你自己写的规则(不读取线上的 robots.txt)”,粘贴草稿后点“开始测试”,同一个网址和所有爬虫都会按你的草稿判断。
怎么屏蔽 GPTBot 这类 AI 爬虫?
为每个爬虫单独写一组规则,比如 User-agent: GPTBot 下一行写 Disallow: /。本工具会测试 GPTBot、ClaudeBot、Google-Extended、CCBot 和 PerplexityBot,AI 爬虫访问检测则覆盖 25 个 AI 爬虫。
把Robots.txt 检测分享给朋友打开浏览器就能用,对方不注册也能先试。

相关工具

SEO 死链检测检查一个网页上的全部链接,列出失效和跳转的链接。
SEO 网站 SEO 检测一次检查 40 多项页面和技术 SEO,每个问题都给出改法。
SEO 网页可收录检测一次查清网页能不能被收录:状态码、robots、noindex 和 canonical。
SEO 关键词密度检测统计网页或文章里出现最多的词和短语,以及各自的占比。
SEO Meta 标签检测查看网页的标题、描述、robots、canonical 和分享标签,并检查长度。
SEO 搜索引擎蜘蛛模拟抓取以百度蜘蛛、谷歌机器人的身份抓取网页,看它们看到的内容和普通访客是否一样。
TXT 广告法违禁词检测标出文案里违反《广告法》的极限词和违禁用语。
SEO AI 爬虫访问检测看网站的 robots.txt 放行了哪些 AI 爬虫(GPTBot、ClaudeBot、Google-Extended 等)。