关于Robots.txt 检测
robots.txt 写错一行,整站都可能从搜索结果里消失,所以要做 robots.txt 检测。上传新规则前、页面从百度或谷歌掉出去时、想知道 AI 爬虫能否抓你的内容时,都可以测一测。输入完整的页面网址,点开始测试;默认读取线上的 robots.txt,也可以粘贴草稿先试。
规则按谷歌的做法和 RFC 9309 解析:支持 * 通配符和 $ 结尾,最长的匹配规则生效,一样长时 Allow 优先,并选用最具体的 user-agent 分组。路径会对 20 个爬虫逐一测试,包括百度蜘蛛、谷歌蜘蛛、必应、360、搜狗、神马和 GPTBot 等 AI 爬虫,也可以加自定义爬虫。每一行显示放行还是禁止和起作用的规则,文件里对应的行会高亮。全站 Disallow: /、屏蔽 CSS 或 JS、语法错误、缺少 Sitemap 行、Crawl-delay、文件超过 500 KB 或返回错误状态码,都会提醒。新规则可以用 Robots.txt 生成器生成。
Robots.txt 检测怎么用
- 1输入页面网址
填要测试的完整网址,而不只是域名。
- 2加爬虫或草稿
可以填自定义爬虫名称,或粘贴规则草稿代替线上文件。
- 3点“开始测试”
每个爬虫都得到放行或禁止的结论。
- 4看起作用的行
在文件视图里找到高亮的规则,按需修改。
为什么用熊仔工匠
- 按谷歌规则判断
通配符、$ 结尾、最长匹配、Allow 优先,遵循 RFC 9309。
- 20 个爬虫一起测
百度、谷歌、360、搜狗、神马等搜索引擎,加上主流 AI 爬虫。
- 上线前测草稿
粘贴规则先测试,确认无误再上传。
- 常见错误提醒
全站屏蔽、屏蔽 CSS/JS、语法错误、缺少 Sitemap 行。