免費註冊

百度真假蜘蛛識別

貼上日誌裡的 IP,判斷來訪的百度蜘蛛、谷歌蜘蛛是不是真的。

關於百度真假蜘蛛識別

採集器常常冒充百度蜘蛛或谷歌蜘蛛,好讓防火牆放行。日誌裡“蜘蛛”訪問量突然暴漲、準備把蜘蛛 IP 加進白名單、或者看到“蜘蛛”在抓不該抓的頁面時,就該驗一驗真假。每行貼上一個 IP,訪客一次最多 10 個,登入會員 20 個,VIP 100 個,點開始識別。

每個 IP 先做反向解析(PTR),檢查主機名是否以對應搜尋引擎的官方域名結尾,比如百度的 baidu.com、baidu.jp,谷歌的 googlebot.com、google.com,必應的 search.msn.com,搜狗、360、神馬、華為、位元組跳動等也都覆蓋;再做正向解析,確認這個主機名指回同一個 IP。谷歌、必應和 OpenAI(GPTBot)公佈的爬蟲 IP 列表也會核對。每個 IP 得到一個結論:真蜘蛛、假冒或不是蜘蛛,表格可以匯出 CSV。只想查一個 IP 的 PTR 記錄,用反向解析 PTR 查詢。

百度真假蜘蛛識別怎麼用

  1. 1
    從日誌裡取 IP

    挑出自稱百度蜘蛛、谷歌蜘蛛等的訪問 IP。

  2. 2
    每行貼上一個

    訪客最多 10 個,會員 20 個,VIP 100 個。

  3. 3
    點“開始識別”

    依次做反向解析、正向確認,並核對公佈的 IP 列表。

  4. 4
    按結論處理

    遮蔽假蜘蛛,真蜘蛛保持放行。

為什麼用熊仔工匠

  • 雙向 DNS 驗證

    先查 PTR 主機名,再正向解析回 IP。

  • 覆蓋 13 家

    百度、谷歌、必應、搜狗、360、神馬、華為、位元組跳動、蘋果、Yandex、Naver、Seznam、DuckDuckGo。

  • 核對公佈的 IP 段

    谷歌、必應和 OpenAI GPTBot 的官方 IP 列表。

  • 結論清楚

    真蜘蛛、假冒、不是蜘蛛,可匯出 CSV。

常見問題

百度真假蜘蛛識別常見問題

怎麼判斷百度蜘蛛是真是假?
對 IP 做反向解析,真百度蜘蛛的主機名以 baidu.com 或 baidu.jp 結尾;再確認這個主機名解析回同一個 IP。本工具一次完成這兩步。真蜘蛛在抓不該抓的頁面時,可以用 Robots.txt 檢測找出放行它的規則。
只看 UA 為什麼不夠?
User-Agent 誰都能隨便寫成 Baiduspider。只有 DNS 驗證和官方公佈的 IP 列表,才能證明請求真的來自搜尋引擎。
“不是蜘蛛”是什麼意思?
這個 IP 的反向解析不屬於任何已知的蜘蛛,也不在公佈的 IP 列表裡,可能是普通訪客、雲伺服器或未知的爬蟲。
一次能查多少個 IP?
訪客每次 10 個,登入會員 20 個,VIP 100 個。免費使用,不佔每日任務次數。
假蜘蛛該怎麼處理?
可以在防火牆或伺服器上按 IP 遮蔽。遮蔽前先用本工具確認,別誤傷真蜘蛛,否則會影響收錄。
把百度真假蜘蛛識別分享給朋友開啟瀏覽器就能用,對方不註冊也能先試。

相關工具

SEO 死鏈檢測檢查一個網頁上的全部連結,列出失效和跳轉的連結。
SEO 網站 SEO 檢測一次檢查 40 多項頁面和技術 SEO,每個問題都給出改法。
SEO 網頁可收錄檢測一次查清網頁能不能被收錄:狀態碼、robots、noindex 和 canonical。
SEO 關鍵詞密度檢測統計網頁或文章裡出現最多的詞和短語,以及各自的佔比。
SEO Meta 標籤檢測檢視網頁的標題、描述、robots、canonical 和分享標籤,並檢查長度。
SEO Robots.txt 檢測讀取網站的 robots.txt,測試某個網址對各個爬蟲是否放行。
SEO 搜尋引擎蜘蛛模擬抓取以百度蜘蛛、谷歌機器人的身份抓取網頁,看它們看到的內容和普通訪客是否一樣。
TXT 廣告法違禁詞檢測標出文案裡違反《廣告法》的極限詞和違禁用語。