免费注册

百度真假蜘蛛识别

粘贴日志里的 IP,判断来访的百度蜘蛛、谷歌蜘蛛是不是真的。

关于百度真假蜘蛛识别

采集器常常冒充百度蜘蛛或谷歌蜘蛛,好让防火墙放行。日志里“蜘蛛”访问量突然暴涨、准备把蜘蛛 IP 加进白名单、或者看到“蜘蛛”在抓不该抓的页面时,就该验一验真假。每行粘贴一个 IP,访客一次最多 10 个,登录会员 20 个,VIP 100 个,点开始识别。

每个 IP 先做反向解析(PTR),检查主机名是否以对应搜索引擎的官方域名结尾,比如百度的 baidu.com、baidu.jp,谷歌的 googlebot.com、google.com,必应的 search.msn.com,搜狗、360、神马、华为、字节跳动等也都覆盖;再做正向解析,确认这个主机名指回同一个 IP。谷歌、必应和 OpenAI(GPTBot)公布的爬虫 IP 列表也会核对。每个 IP 得到一个结论:真蜘蛛、假冒或不是蜘蛛,表格可以导出 CSV。只想查一个 IP 的 PTR 记录,用反向解析 PTR 查询。

百度真假蜘蛛识别怎么用

  1. 1
    从日志里取 IP

    挑出自称百度蜘蛛、谷歌蜘蛛等的访问 IP。

  2. 2
    每行粘贴一个

    访客最多 10 个,会员 20 个,VIP 100 个。

  3. 3
    点“开始识别”

    依次做反向解析、正向确认,并核对公布的 IP 列表。

  4. 4
    按结论处理

    屏蔽假蜘蛛,真蜘蛛保持放行。

为什么用熊仔工匠

  • 双向 DNS 验证

    先查 PTR 主机名,再正向解析回 IP。

  • 覆盖 13 家

    百度、谷歌、必应、搜狗、360、神马、华为、字节跳动、苹果、Yandex、Naver、Seznam、DuckDuckGo。

  • 核对公布的 IP 段

    谷歌、必应和 OpenAI GPTBot 的官方 IP 列表。

  • 结论清楚

    真蜘蛛、假冒、不是蜘蛛,可导出 CSV。

常见问题

百度真假蜘蛛识别常见问题

怎么判断百度蜘蛛是真是假?
对 IP 做反向解析,真百度蜘蛛的主机名以 baidu.com 或 baidu.jp 结尾;再确认这个主机名解析回同一个 IP。本工具一次完成这两步。真蜘蛛在抓不该抓的页面时,可以用 Robots.txt 检测找出放行它的规则。
只看 UA 为什么不够?
User-Agent 谁都能随便写成 Baiduspider。只有 DNS 验证和官方公布的 IP 列表,才能证明请求真的来自搜索引擎。
“不是蜘蛛”是什么意思?
这个 IP 的反向解析不属于任何已知的蜘蛛,也不在公布的 IP 列表里,可能是普通访客、云服务器或未知的爬虫。
一次能查多少个 IP?
访客每次 10 个,登录会员 20 个,VIP 100 个。免费使用,不占每日任务次数。
假蜘蛛该怎么处理?
可以在防火墙或服务器上按 IP 屏蔽。屏蔽前先用本工具确认,别误伤真蜘蛛,否则会影响收录。
把百度真假蜘蛛识别分享给朋友打开浏览器就能用,对方不注册也能先试。

相关工具

SEO 死链检测检查一个网页上的全部链接,列出失效和跳转的链接。
SEO 网站 SEO 检测一次检查 40 多项页面和技术 SEO,每个问题都给出改法。
SEO 网页可收录检测一次查清网页能不能被收录:状态码、robots、noindex 和 canonical。
SEO 关键词密度检测统计网页或文章里出现最多的词和短语,以及各自的占比。
SEO Meta 标签检测查看网页的标题、描述、robots、canonical 和分享标签,并检查长度。
SEO Robots.txt 检测读取网站的 robots.txt,测试某个网址对各个爬虫是否放行。
SEO 搜索引擎蜘蛛模拟抓取以百度蜘蛛、谷歌机器人的身份抓取网页,看它们看到的内容和普通访客是否一样。
TXT 广告法违禁词检测标出文案里违反《广告法》的极限词和违禁用语。