自己的網站可在 Screaming Frog 設定中選擇忽略 robots.txt 做內部稽核;第三方網站仍應遵守對方規則與授權。忽略 robots 只改工具行為,不會改 Googlebot 看到的狀態。

檢查時應保留兩次 crawl:一次遵守 robots 看搜尋引擎可見範圍,一次在獲授權下忽略規則看完整網站。兩份差異才是封鎖問題清單。

先看哪些訊號,再決定怎麼處理

檢查訊號代表什麼下一步
遵守 robots 時大量 URL 消失搜尋 crawler 也可能看不到檢查 Disallow 規則
忽略 robots 後才看到 noindexGooglebot可能讀不到 meta重新設計抓取與索引控制
目標不是自有網站可能沒有測試授權停止繞過,改用公開可存取資料

操作示例

操作示例:先用預設設定 crawl 並匯出 blocked URLs;取得站方授權後,再設定忽略 robots 重跑。以 URL 為鍵比對兩份結果,優先修本來應公開的重要頁。

最容易誤判的地方

適用與不適用情境

適合用在 適合自有網站或已明確獲得技術稽核授權的專案。
不適合直接套用 沒有網站所有者授權時,不應用工具繞過封鎖。

接下來怎麼做

  1. 保存遵守 robots 的基準 crawl
  2. 只在授權環境跑完整 crawl
  3. 修正規則後再以預設模式驗收