Website Crawler
継続的に管理されている Web サイトが参照元で、各ページを手作業でアップロードせずに、選択した公開ページを Agent に検索させたい場合は Website Crawler を使います。
目的はサイト全体のコピーではありません。Agent が回答を許可されている質問に対して、範囲が明確で確認可能な Knowledge Base folder を作ることです。
クロール前に確認すること
- チームが対象ページを収集・利用する権限を持っている
- ページに sign-in が不要で、非公開の顧客データを含まない
- 対象セクションに明確な owner と更新手順がある
- 内容がこの Agent の検証済みシナリオを支えている
曖昧な scope や古い source を補うために広範囲をクロールしないでください。
Web サイト同期 folder を作成する
Knowledge Baseを開き、workspace を選択します。New Website Crawlを選びます。Start URLを入力します。- crawl の境界を設定して保存します。
- credit 見積もりを確認し、同期を開始します。
crawler は専用 folder を作成します。必要なページの処理が完了してから Agent に接続してください。
説明できる境界を設定する
| 設定 | 制御する内容 | 実用的な使い方 |
|---|---|---|
Max depth |
Start URL から何階層の link をたどるか | 一つの docs や policy セクションなら低く保ちます。 |
Page limit |
crawler provider に要求する最大ページ数 | 正確な最終件数ではなく、費用とレビュー範囲の上限として使います。 |
Include path |
収集可能な path | /docs/*、/help/* などに限定します。 |
Exclude path |
除外する path | login、account、search、archive、重複 locale を除外します。 |
Allow subdomains |
subdomain の link をたどるか | 承認済み source が subdomain にまたがる場合だけ有効にします。 |
Ignore query parameters |
tracking parameter などの URL variation を同一ページとして扱うか | parameter が重複を生む場合に有効にします。 |
Ignore sitemap |
sitemap discovery を使わないか | sitemap が古い、または意図した範囲を広げる場合だけ使います。 |
Sync main content only |
navigation や反復する page chrome を減らすか | menu や footer が検索ノイズになる場合は有効にします。 |
複数の path pattern はカンマで区切ります。* は任意の文字列に一致し、* のない path はその path と子ページに一致します。
同期前に credit を理解する
同期開始時に、page limit と表示されているページ単価に基づいて credit が確保されます。job 完了後、正常に download できたページだけが課金され、未使用の確保分は返却されます。
redirect、concurrency、sitemap 処理により、provider が最終的に発見・download する件数は page limit と少し異なる場合があります。見積もりが高すぎる場合は、page limit を下げるか path を絞ってください。
利用前に結果を確認する
同期 panel は二つの段階を分けて表示します。
- Page Fetching: 発見、download、download 失敗のページ数
- Knowledge Processing: 処理済み、失敗、skip のページ数
どちらかに問題がある場合は Failure details を開きます。対象 URL をコピーまたは開き、scope に含めるべきかを判断してから、境界または source を修正して再同期します。
download に成功しても、Knowledge Processing が完了するまでは Agent は利用できません。
Folder を接続してテストする
- crawler folder を Agent の
Knowledge Basetool に追加します。 - この Web サイトが答える質問を
When to Useに明記します。 - 想定質問、近接する boundary、別の source が答えるべき質問を一つずつ試します。
- Agent が意図したページを取得し、サイト全体を無関係な話題の権威として扱わないことを確認します。
Web サイト同期は operator が実行します。重要なページが変わったら、接続内容が自動更新されたと想定せず、再同期して影響を受ける cases を再実行してください。