关于搜索引擎蜘蛛模拟抓取
蜘蛛模拟抓取能让你看到服务器给蜘蛛返回了什么。页面排名到莫名其妙的词、怀疑网站被黑后只给搜索引擎展示垃圾内容、想确认正文没有藏在脚本中,都可以先模拟一次。在“蜘蛛”里选百度、谷歌(都有电脑版和移动版)、必应、360、搜狗或 Yandex 蜘蛛,输入网址,点模拟抓取。
页面会以所选蜘蛛的身份抓取一次,同时以普通浏览器的身份再抓一次。你能看到状态码、最终地址、标题、描述、关键词、robots 标签、标题大纲、蜘蛛读到的正文和字数,以及它发现的链接表。两个版本会比较正文相似度、标题和链接数量,差得太多往往就是隐藏内容(cloaking)或被黑后的跳转;robots.txt 是否允许这个蜘蛛抓取也会一并显示。请求从我们的服务器带着蜘蛛的 UA 发出,并非来自搜索引擎自己的 IP,所以校验蜘蛛 IP 的网站可能会区别对待。要判断日志里的蜘蛛真假,用百度真假蜘蛛识别。
搜索引擎蜘蛛模拟抓取怎么用
- 1输入网址
填要模拟抓取的页面地址。
- 2选择蜘蛛
百度、谷歌、必应、360、搜狗、Yandex 任选。
- 3点“模拟抓取”
以蜘蛛和普通浏览器两个身份同时抓取。
- 4对比两个版本
看相似度、标题和链接,再读蜘蛛拿到的正文。
为什么用熊仔工匠
- 八种蜘蛛身份
百度(电脑、移动)、谷歌(电脑、手机)、必应、360、搜狗、Yandex。
- 与访客对比
正文相似度百分比、标题和链接数量。
- 蜘蛛读到的内容
正文、标题大纲、链接和字数,按服务器返回的原样显示。
- robots 结论
顺带显示 robots.txt 是否允许这个蜘蛛抓取。