先分開搜尋曝光、使用者即時請求與模型訓練。允許搜尋 crawler 不代表必須允許訓練 crawler;是否開放應依內容授權、商業模式與可見度目標逐一決定。
OpenAI 公開區分 OAI-SearchBot、GPTBot 與 ChatGPT-User;Anthropic 也提供 crawler 控制說明。robots.txt 應按 user-agent 設定,不用一條規則封鎖所有 AI 工具。
先看哪些訊號,再決定怎麼處理
| 檢查訊號 | 代表什麼 | 下一步 |
|---|---|---|
| 希望出現在 AI 搜尋答案 | 需要搜尋 crawler 可存取 | 保留搜尋用途 crawler |
| 內容授權限制訓練 | 訓練用途不符合政策 | 封鎖對應訓練 crawler |
| 使用者要求 ChatGPT 開啟頁面 | 屬 user-triggered fetch | 依服務與安全需求決定 |
操作示例
操作示例:列出每個 crawler、用途、目前規則、允許理由與負責人。修改 robots 後用伺服器 log 驗證實際 user-agent,不把名稱相近的 bot 合併處理。
最容易誤判的地方
- 把 Google-Extended、Googlebot 與 GPTBot 當同一用途
- 為了阻擋訓練而誤封搜尋索引 crawler
適用與不適用情境
適合用在
適合有原創、付費或授權內容,需要明確 AI 使用政策的網站。
不適合直接套用
如果團隊還沒定義內容權利與商業目標,先不要做一刀切設定。
接下來怎麼做
- 盤點 crawler 與內容授權
- 分搜尋、訓練、使用者請求設定規則
- 用 log 與定期文件查核驗收