Image Generation
Image Generation 適合用在 Agent 需要在對話中直接產生或修改圖片的情境。
Agent 可以根據文字描述產圖、參考 Knowledge Base 中選取或使用者在目前對話附上的圖片產生新版本,也可以修改同一段對話稍早生成的圖片。
什麼情況適合用 Image Generation
適合:
- 使用者明確要求 Agent 產生一張新圖片
- 新圖片需要延續現有參考圖的主體、構圖或視覺方向
- 使用者附上一張圖片,並要求產生變化版本或進行修改
- 使用者想修改同一段對話稍早生成的圖片
- 回答不只需要文字,也需要視覺草稿
- 目前先有一張可討論、可審閱的草稿就夠了,之後可以再由人調整
不適合:
- 使用者只想查看或下載既有圖片,不需要改動
- 你需要原封不動地回傳已核准的品牌素材
- 這份工作本來就需要設計師做精準的最終正式稿,不能先用生成內容代替
步驟 1:加入 Image Generation
在 Editor 的 Tools 裡按 Add Tool,選 Image Generation。
步驟 2:選擇 Image Model
在 Image Model 裡選 Agent 要用的圖片模型。
第一版先保持簡單即可,一個模型就夠你驗證整個流程。
參考圖與修改能力會因模型而異
有些模型可以根據文字產圖,但使用參考圖或修改既有圖片的能力未必同樣穩定。請用預計採用的參考與修改流程實際測試所選模型。
步驟 3:需要時連接參考圖片
如果要讓 Agent 根據既有圖片產生新版本,請同時加入 Knowledge Base,並選取它可以使用的 standalone 圖片。圖片必須完成處理並顯示為 Ready,才能作為產圖參考。
如果只是單次使用,使用者也可以直接在目前對話附上圖片,不必先加入 Knowledge Base。
Agent 也可以修改同一段對話稍早生成的圖片。每次修改都會建立一張新圖片,不會覆寫先前的結果。
每次產圖最多可使用四張輸入圖片。Agent 可以選一張作為要修改的 base image,其餘作為 reference。先前生成的圖片必須已經成為對話紀錄中的完整結果才能再次使用;同一次 tool run 剛產生的圖片不能立刻再餵回去。
當設定的模型是 GPT Image 2 時,在支援的 Chat 介面中,使用者可以對已生成的圖片選擇 編輯區域、框出一個矩形選區,再描述要修改的內容。Codeer 會把選區綁定到 base image,並在 server 端產生 provider 所需的 mask;使用者與 Agent 都不需要上傳或自行建立 mask。選區只會引導修改範圍,模型不一定會以像素級精度完全貼合邊界。
請在 Instructions 或 When to Use 說明 Agent 何時應該尋找參考圖、哪些內容必須保留,以及哪些內容可以改動。例如:
When the user asks for a campaign variation, find the matching Ready reference image in Knowledge Base, preserve its recognizable subject and layout direction, and generate a new draft using the user's requested changes. When revising an earlier generated image, preserve everything the user did not ask to change.
步驟 4:把 When to Use 寫窄
不要讓圖片生成變成 Agent 的預設反應,而是要讓它成為一個有條件的行為。
例如:
Use this tool when the user asks for a new visual concept, a variation based on an available reference, or a revision to an image generated earlier in this conversation. Do not use it for factual questions or when an existing approved asset should be returned unchanged.
這種寫法的好處是,它同時說清楚了:
- 哪些需求才該觸發這個工具
- 哪些情況不該用
- 什麼時候應該產生新草稿,什麼時候應該重用既有素材
步驟 5:用明確需要圖片的問題來測
例如:
可以幫我做一張法律諮詢 landing page 的 hero image 概念圖嗎?請用乾淨的 flat style,畫一張 onboarding flow 的簡單插圖。請參考 Knowledge Base 裡核准的藍色產品圖,產生一張直式活動版本。請用我附上的圖片產生一張淺色背景的正方形版本。修改你剛剛產生的圖片:保留構圖,但把標題放大。
測試時確認:
- Agent 真的有呼叫這個工具
- 需要時有使用正確的參考圖或先前生成的圖片
- 產出的圖片方向符合你的要求
- 面對一般文字問題時,Agent 不會亂產圖
Agent 在執行時還能控制什麼
工具設定表單本身只會讓你選模型,並填寫 When to Use。
真正對話時,Agent 還是可以自行決定一些圖片生成細節,例如:
- 送給模型的文字 prompt
- 額外的 style 描述
- 模型支援時可用的 aspect ratio
- 哪一張可用圖片應該作為參考或修改目標
- 哪一張圖片(若有)應作為唯一的修改 base,其餘圖片則作為 reference
- 當支援的 Chat 介面啟動
GPT Image 2局部修改時,如何套用使用者建立且不可變的區域選取
所以你的設定重點,不是把每個視覺細節都硬寫進工具,而是定義「這個 Agent 什麼情況可以產圖、可以產哪一類圖」。
操作建議
- 觸發條件要寫窄,避免使用者沒要求圖片時也被誤觸發。
- 如果圖片要遵守品牌、活動視覺或產品風格,請把規則寫進
Instructions,並在 Agent 的Knowledge Basetool 選取相關 standalone 圖片。 - 單次使用的參考圖可以直接附在對話中;如果 Agent 需要跨對話尋找或重複使用圖片,請放進 Knowledge Base。
- 如果你想讓 Agent 具備不同的產圖行為,可以加多個
Image Generation工具,並替每個工具寫清楚不同的When to Use。 - 除非你的流程有明確人工審核,不然請把生成圖片視為草稿,而不是最後定稿。
常見錯誤
When to Use 寫太空泛
像 Use this tool when visuals are helpful 這種寫法太鬆,Agent 很難穩定判斷。
明明有現成素材,卻還是叫 Agent 重畫
如果正確的 logo、示意圖或活動素材應該原封不動地使用,就應該回傳原始素材,而不是重產一個近似版本。只有在使用者真的要新版本時,才把它當成產圖參考。
以為只要換模型就能補救模糊需求
模型選擇很重要,但前提還是要有清楚的請求和明確的產圖邊界。