跳轉到

Website Crawler

當網站是持續維護的參考來源,而且 Agent 應該查找其中一小段公開頁面,不適合逐頁手動上傳時,可以使用 Website Crawler

目標不是把整個網站複製進來,而是替 Agent 已核准回答的問題,建立一個範圍明確、可檢查的 Knowledge Base 資料夾。

開始前先確認

  • 團隊有權收集並使用這些頁面
  • 頁面不需要登入,也不包含客戶私密資料
  • 這個網站區段有明確 owner 與更新流程
  • 內容確實支援這個 Agent 的已驗證情境

不要用大範圍 crawl 來補救模糊的工作範圍或過期來源。

建立網站同步資料夾

  1. 打開 Knowledge Base,選取 workspace。
  2. 選擇 New Website Crawl
  3. 輸入 Start URL
  4. 設定 crawl 邊界後儲存。
  5. 檢查 credits 估算,再開始同步。

系統會建立專用資料夾。等相關頁面處理完成後,再把資料夾接到 Agent。

設定一個說得清楚的邊界

設定 控制內容 實務用法
Max depth 從起始網址向外追蹤幾層連結 只抓一段文件或政策區時保持較低深度。
Page limit 要求 crawler provider 處理的頁數上限 把它當成成本與檢查邊界,不要當成精確最終頁數。
Include path 允許收集的路徑 限定在 /docs/*/help/* 等區段。
Exclude path 一定要排除的路徑 排除登入、帳號、搜尋、archive 或重複語系路徑。
Allow subdomains 是否追蹤子網域連結 除非核准來源跨子網域,否則保持關閉。
Ignore query parameters 追蹤參數等 URL 變體是否視為同一頁 query parameters 造成重複頁面時開啟。
Ignore sitemap 是否略過 sitemap discovery 只有 sitemap 過期或超出預定範圍時才使用。
Sync main content only 是否減少導覽列與重複頁面外框 選單與 footer 造成檢索雜訊時保持開啟。

多個 path pattern 請用逗號分隔。* 代表任意文字;沒有 * 的 path 會比對該路徑及其子頁面。

同步前先看懂 credits

開始同步時,系統會依 page limit 與畫面顯示的每頁費率預留 credits。工作完成後,只計收成功下載的頁面,沒有使用的預留 credits 會退回。

因為 redirect、concurrency 或 sitemap 處理方式,provider 最後發現或下載的頁數可能和 page limit 略有差異。估算太高時,請降低 page limit 或縮小路徑。

使用前確認同步結果

同步面板把工作分成兩個階段:

  • Page Fetching:發現、下載與下載失敗的頁面數
  • Knowledge Processing:處理成功、失敗與略過的頁面數

任一階段有問題時,打開 Failure details。複製或開啟受影響的 URL,先判斷它是否應在範圍內,再修正邊界或來源後重新同步。

頁面下載成功,不代表 Agent 已經可以使用;Knowledge Processing 也必須成功。

連接資料夾並測試

  1. 把 crawler 資料夾加入 Agent 的 Knowledge Base tool。
  2. When to Use 寫清楚這個網站負責回答哪些問題。
  3. 測一個預期問題、一個鄰近邊界,以及一個應該由其他來源回答的問題。
  4. 確認 Agent 找到預定頁面,也不會把整個網站當成所有主題的權威來源。

網站同步由 operator 主動控制。重要頁面更新時,請重新同步並重跑受影響 cases,不要假設接進來的內容已自動更新。

相關指南