自己的網站可在 Screaming Frog 設定中選擇忽略 robots.txt 做內部稽核;第三方網站仍應遵守對方規則與授權。忽略 robots 只改工具行為,不會改 Googlebot 看到的狀態。
檢查時應保留兩次 crawl:一次遵守 robots 看搜尋引擎可見範圍,一次在獲授權下忽略規則看完整網站。兩份差異才是封鎖問題清單。
先看哪些訊號,再決定怎麼處理
| 檢查訊號 | 代表什麼 | 下一步 |
|---|---|---|
| 遵守 robots 時大量 URL 消失 | 搜尋 crawler 也可能看不到 | 檢查 Disallow 規則 |
| 忽略 robots 後才看到 noindex | Googlebot可能讀不到 meta | 重新設計抓取與索引控制 |
| 目標不是自有網站 | 可能沒有測試授權 | 停止繞過,改用公開可存取資料 |
操作示例
操作示例:先用預設設定 crawl 並匯出 blocked URLs;取得站方授權後,再設定忽略 robots 重跑。以 URL 為鍵比對兩份結果,優先修本來應公開的重要頁。
最容易誤判的地方
- 把 robots.txt 當成可靠的去索引工具
- 忽略 robots 後就認為 Google 也能看到那些頁
適用與不適用情境
適合用在
適合自有網站或已明確獲得技術稽核授權的專案。
不適合直接套用
沒有網站所有者授權時,不應用工具繞過封鎖。
接下來怎麼做
- 保存遵守 robots 的基準 crawl
- 只在授權環境跑完整 crawl
- 修正規則後再以預設模式驗收