關於Robots.txt 檢測
robots.txt 寫錯一行,整站都可能從搜尋結果裡消失,所以要做 robots.txt 檢測。上傳新規則前、頁面從百度或谷歌掉出去時、想知道 AI 爬蟲能否抓你的內容時,都可以測一測。輸入完整的頁面網址,點開始測試;預設讀取線上的 robots.txt,也可以貼上草稿先試。
規則按谷歌的做法和 RFC 9309 解析:支援 * 萬用字元和 $ 結尾,最長的匹配規則生效,一樣長時 Allow 優先,並選用最具體的 user-agent 分組。路徑會對 20 個爬蟲逐一測試,包括百度蜘蛛、谷歌蜘蛛、必應、360、搜狗、神馬和 GPTBot 等 AI 爬蟲,也可以加自定義爬蟲。每一行顯示放行還是禁止和起作用的規則,檔案裡對應的行會高亮。全站 Disallow: /、遮蔽 CSS 或 JS、語法錯誤、缺少 Sitemap 行、Crawl-delay、檔案超過 500 KB 或返回錯誤狀態碼,都會提醒。新規則可以用 Robots.txt 生成器生成。
Robots.txt 檢測怎麼用
- 1輸入頁面網址
填要測試的完整網址,而不只是域名。
- 2加爬蟲或草稿
可以填自定義爬蟲名稱,或貼上規則草稿代替線上檔案。
- 3點“開始測試”
每個爬蟲都得到放行或禁止的結論。
- 4看起作用的行
在檔案檢視裡找到高亮的規則,按需修改。
為什麼用熊仔工匠
- 按谷歌規則判斷
萬用字元、$ 結尾、最長匹配、Allow 優先,遵循 RFC 9309。
- 20 個爬蟲一起測
百度、谷歌、360、搜狗、神馬等搜尋引擎,加上主流 AI 爬蟲。
- 上線前測草稿
貼上規則先測試,確認無誤再上傳。
- 常見錯誤提醒
全站遮蔽、遮蔽 CSS/JS、語法錯誤、缺少 Sitemap 行。