关于Robots.txt 生成器
用 Robots.txt 生成器写好的 robots.txt 放在网站根目录,告诉各家蜘蛛哪些目录可以抓、哪些不要抓。新站上线、后台目录不想被抓取、测试站不希望蜘蛛来访,或者不想让文章被拿去训练 AI,都用得上它。先选对所有爬虫的默认规则:全部放行或全部屏蔽;再把要屏蔽的目录一行一个填进去,比如 /admin/、/cart/;加上 Sitemap 地址,需要时再设抓取间隔。生成结果随填随变。还没有 sitemap 的话,可以先用网站地图 Sitemap 生成器生成一个。
每个爬虫都有单独的开关:搜索引擎有百度、谷歌、必应、360、搜狗、神马、Yandex 和 DuckDuckGo 八家的蜘蛛;AI 爬虫有 GPTBot、ClaudeBot、Google-Extended、字节跳动的 Bytespider 等 9 个,另有一键屏蔽 AI 训练爬虫的预设。复制或下载 robots.txt,上传到网站根目录,再用 Robots.txt 检测试试具体网址对各家蜘蛛是否放行。全程在浏览器里完成,不上传任何内容。
Robots.txt 生成器怎么用
- 1选默认规则
先决定对所有爬虫默认全部放行,还是全部屏蔽。
- 2填目录和网站地图
要屏蔽的目录一行一个,再填 Sitemap 地址,需要时加上抓取间隔。
- 3逐个设置蜘蛛
按需开关百度、谷歌等搜索引擎和各家 AI 爬虫,也可以一键屏蔽 AI 训练爬虫。
- 4下载并上传
复制或下载 robots.txt,放到网站根目录,再用 Robots.txt 检测验证。
为什么用熊仔工匠
- 国内蜘蛛都有
百度、360、搜狗、神马,以及谷歌、必应、Yandex、DuckDuckGo 的爬虫都能单独设置。
- 9 个 AI 爬虫
GPTBot、ClaudeBot、Google-Extended、CCBot、PerplexityBot、Bytespider 等逐个开关。
- 一键屏蔽 AI 训练
不用自己写规则,点一下就屏蔽收集训练数据的 AI 爬虫。
- 本地实时生成
在浏览器里随填随生成,不上传、不占次数,页面打开后断网也能用。