關於搜尋引擎蜘蛛模擬抓取
蜘蛛模擬抓取能讓你看到伺服器給蜘蛛返回了什麼。頁面排名到莫名其妙的詞、懷疑網站被黑後只給搜尋引擎展示垃圾內容、想確認正文沒有藏在指令碼中,都可以先模擬一次。在“蜘蛛”裡選百度、谷歌(都有電腦版和移動版)、必應、360、搜狗或 Yandex 蜘蛛,輸入網址,點模擬抓取。
頁面會以所選蜘蛛的身份抓取一次,同時以普通瀏覽器的身份再抓一次。你能看到狀態碼、最終地址、標題、描述、關鍵詞、robots 標籤、標題大綱、蜘蛛讀到的正文和字數,以及它發現的連結表。兩個版本會比較正文相似度、標題和連結數量,差得太多往往就是隱藏內容(cloaking)或被黑後的跳轉;robots.txt 是否允許這個蜘蛛抓取也會一併顯示。請求從我們的伺服器帶著蜘蛛的 UA 發出,並非來自搜尋引擎自己的 IP,所以校驗蜘蛛 IP 的網站可能會區別對待。要判斷日誌裡的蜘蛛真假,用百度真假蜘蛛識別。
搜尋引擎蜘蛛模擬抓取怎麼用
- 1輸入網址
填要模擬抓取的頁面地址。
- 2選擇蜘蛛
百度、谷歌、必應、360、搜狗、Yandex 任選。
- 3點“模擬抓取”
以蜘蛛和普通瀏覽器兩個身份同時抓取。
- 4對比兩個版本
看相似度、標題和連結,再讀蜘蛛拿到的正文。
為什麼用熊仔工匠
- 八種蜘蛛身份
百度(電腦、移動)、谷歌(電腦、手機)、必應、360、搜狗、Yandex。
- 與訪客對比
正文相似度百分比、標題和連結數量。
- 蜘蛛讀到的內容
正文、標題大綱、連結和字數,按伺服器返回的原樣顯示。
- robots 結論
順帶顯示 robots.txt 是否允許這個蜘蛛抓取。