資源中心 · 指南
robots.txt 應否放行 AI 爬蟲?香港網站的實務取捨
robots.txt 可向守規則的爬蟲表達允許或禁止抓取的路徑,但不是存取控制、不能保證 AI 引用,也無法約束所有客戶端。香港網站應分清搜尋索引、即時檢索與訓練用途,按法律、合約與業務目標決定放行範圍,並定期測試重要 URL 沒有被誤封鎖。
robots.txt 可向守規則的爬蟲表達允許或禁止抓取的路徑,但不是存取控制、不能保證 AI 引用,也無法約束所有客戶端。香港網站應分清搜尋索引、即時檢索與訓練用途,按法律、合約與業務目標決定放行範圍,並定期測試重要 URL 沒有被誤封鎖。
這篇適合誰
適合網站負責人、技術 SEO、法務/資訊保安需要對齊爬蟲政策的香港團隊。若目標是 GEO/AI 能見度,技術放行只是條件之一;內容與實體仍要可核實。見AI 搜尋技術基礎。
先分三種 AI 相關存取
- 搜尋索引:如 Googlebot,影響傳統搜尋與部分 AI 摘要候選。
- 即時/搜尋型助手爬蟲:用於回答時檢索公開網頁(名稱與行為因產品而異)。
- 訓練或其他用途爬蟲:可能用於模型資料或其他目的;是否放行屬政策選擇。
訓練與即時搜尋的分別見訓練資料與即時搜尋。
robots.txt 能做與不能做
| 能 | 不能 |
|---|---|
| 向守規則爬蟲表達路徑允許/禁止 | 當登入牆或私隱保護 |
| 減少誤抓後台、參數、測試路徑 | 保證 AI 引用或阻止所有複製 |
| 與 sitemap 策略對齊 | 約束不遵守規則的客戶端 |
決策前要問的五條
- 哪些路徑含登入後、個人或合約敏感資料?
- 業務是否希望出現在 AI 答案與搜尋摘要?
- 法務/客戶合約對爬取與訓練有何要求?
- 現有 Allow/Disallow 是否誤傷 CSS、API 或重要服務頁?
- 誰負責審批與每季覆核 bots 清單?
實作檢查清單
- 用純文字編輯 robots.txt,避免錯誤語法令規則失效。
- 抽查首頁、服務頁、指南與 sitemap 中的 URL 是否被誤 Disallow。
- 確認 Search Console/伺服器日誌中的重要爬蟲狀態。
- 記錄每次 bot 政策變更的日期、原因與批准人。
- 內容更新後,用實際抓取驗證 HTML 可讀。
- 對齊 CDN/WAF 規則,避免「robots 允許但邊緣節點全擋」。
可與Sitemap 檢查、技術 GEO一併審核。
llms.txt 與其他補充檔
llms.txt 等新興慣例最多作補充說明,不能取代可索引 HTML、robots 與真實內容。網站建設清單見網站建設。
治理:誰批准、多久覆核
建議每季或產品/合約變更時覆核:bot 清單、敏感路徑、sitemap 一致性、抽樣抓取結果。變更要有書面原因,避免「某人從網上複製範本」直接上線。
常見錯誤
- 複製海外範本,封鎖搜尋型爬蟲卻放行無關路徑
- 把 robots.txt 當成資安邊界
- 以為寫了 Allow 就等於「已做 GEO」
- sitemap、noindex、密碼門與 CDN 規則互相矛盾
- Disallow 了整個網站資源目錄導致渲染失敗
限制與下一步
爬蟲名稱、用途與遵守程度會改變;不遵守 robots.txt 的客戶端仍可能存在。政策應與法律意見及合約一同檢視,本文不構成法律建議。完整診斷見Audit。
放行爬蟲只表示願意被抓取;是否被引用仍取決於查詢、內容、實體與競爭來源。
關於 robots.txt 應否放行 AI 爬蟲?香港網站的實務取捨 的常見問題
Disallow 全部 AI 爬蟲會不會更安全?
可能減少部分抓取,但也可能影響依賴檢索的答案產品發現你的內容;同時不能阻止使用者貼上內容或已公開轉載。應按用途分開評估,而非一刀切口號。
robots.txt 可以保護客戶私隱資料嗎?
不可以依賴它。不應公開的資料不該放在可被抓取的 URL;需登入、授權與伺服器端控制。robots.txt 本身是公開檔案。
Allow 了 OAI-SearchBot 就一定被 ChatGPT 引用嗎?
不會。放行只表示願意被該爬蟲抓取;是否引用仍取決於查詢、內容品質、實體清晰度、競爭來源與產品設定。
Sitemap 與 robots 衝突怎麼辦?
若 sitemap 列出 URL 但 robots 禁止抓取,爬蟲可能無法取得內容。應讓兩者與 noindex/canonical 策略一致。
llms.txt 可以取代 robots.txt 嗎?
不可以。llms.txt 等新興慣例最多作補充說明;可索引 HTML、robots、權限與真實內容仍是基礎。
CDN 或 WAF 擋爬蟲算不算 robots 策略?
那是另一層存取控制。應分開記錄:robots 表達意願;WAF/登入決定能否取得內容。兩者衝突時要有負責人協調。
下一步:用 Audit 驗證你的品牌現況。
申請 Audit相關教學與下一步
香港企業如何開始 GEO?由基線到持續監測的實施指南
適合準備改善 AI 搜尋能見度的香港企業,逐步說明如何整理中英文品牌資料、建立買家查詢基線、修正高意圖頁面、補足可信來源,並用一致條件監測提及、引用與答案準確度。
如何提高 ChatGPT 正確提及及引用品牌的機會?
為希望在 ChatGPT 搜尋與生成答案中獲得正確品牌描述的香港市場及內容團隊,拆解品牌提及與來源引用的分別,並提供實體一致、答案頁、第三方證據及可重複抽樣的實務方法。
如何製作可被 Perplexity 採用為來源的頁面?
適合管理品牌網站、產品文件及研究內容的團隊,說明 Perplexity 來源頁應如何對齊問題、先給答案、標示日期與證據、處理比較及限制,並用固定查詢驗證引用是否穩定而準確。