Website Crawler
當網站是持續維護的參考來源,而且 Agent 應該查找其中一小段公開頁面,不適合逐頁手動上傳時,可以使用 Website Crawler。
目標不是把整個網站複製進來,而是替 Agent 已核准回答的問題,建立一個範圍明確、可檢查的 Knowledge Base 資料夾。
開始前先確認
- 團隊有權收集並使用這些頁面
- 頁面不需要登入,也不包含客戶私密資料
- 這個網站區段有明確 owner 與更新流程
- 內容確實支援這個 Agent 的已驗證情境
不要用大範圍 crawl 來補救模糊的工作範圍或過期來源。
建立網站同步資料夾
- 打開
Knowledge Base,選取 workspace。 - 選擇
New Website Crawl。 - 輸入
Start URL。 - 設定 crawl 邊界後儲存。
- 檢查 credits 估算,再開始同步。
系統會建立專用資料夾。等相關頁面處理完成後,再把資料夾接到 Agent。
設定一個說得清楚的邊界
| 設定 | 控制內容 | 實務用法 |
|---|---|---|
Max depth |
從起始網址向外追蹤幾層連結 | 只抓一段文件或政策區時保持較低深度。 |
Page limit |
要求 crawler provider 處理的頁數上限 | 把它當成成本與檢查邊界,不要當成精確最終頁數。 |
Include path |
允許收集的路徑 | 限定在 /docs/*、/help/* 等區段。 |
Exclude path |
一定要排除的路徑 | 排除登入、帳號、搜尋、archive 或重複語系路徑。 |
Allow subdomains |
是否追蹤子網域連結 | 除非核准來源跨子網域,否則保持關閉。 |
Ignore query parameters |
追蹤參數等 URL 變體是否視為同一頁 | query parameters 造成重複頁面時開啟。 |
Ignore sitemap |
是否略過 sitemap discovery | 只有 sitemap 過期或超出預定範圍時才使用。 |
Sync main content only |
是否減少導覽列與重複頁面外框 | 選單與 footer 造成檢索雜訊時保持開啟。 |
多個 path pattern 請用逗號分隔。* 代表任意文字;沒有 * 的 path 會比對該路徑及其子頁面。
同步前先看懂 credits
開始同步時,系統會依 page limit 與畫面顯示的每頁費率預留 credits。工作完成後,只計收成功下載的頁面,沒有使用的預留 credits 會退回。
因為 redirect、concurrency 或 sitemap 處理方式,provider 最後發現或下載的頁數可能和 page limit 略有差異。估算太高時,請降低 page limit 或縮小路徑。
使用前確認同步結果
同步面板把工作分成兩個階段:
- Page Fetching:發現、下載與下載失敗的頁面數
- Knowledge Processing:處理成功、失敗與略過的頁面數
任一階段有問題時,打開 Failure details。複製或開啟受影響的 URL,先判斷它是否應在範圍內,再修正邊界或來源後重新同步。
頁面下載成功,不代表 Agent 已經可以使用;Knowledge Processing 也必須成功。
連接資料夾並測試
- 把 crawler 資料夾加入 Agent 的
Knowledge Basetool。 - 在
When to Use寫清楚這個網站負責回答哪些問題。 - 測一個預期問題、一個鄰近邊界,以及一個應該由其他來源回答的問題。
- 確認 Agent 找到預定頁面,也不會把整個網站當成所有主題的權威來源。
網站同步由 operator 主動控制。重要頁面更新時,請重新同步並重跑受影響 cases,不要假設接進來的內容已自動更新。