從一個真實工作開始
理解 Codeer 最快的方法,是帶一個反覆出現、而且仍需要懂行的人判斷結果的真實情境進來。
不要先設定所有功能。先寫一份很短的工作說明:
- 情境:剛剛發生了什麼?誰需要幫助?
- 結果:Agent 應該幫這個人完成什麼?
- 品質:什麼結果才算正確而且有用?
- 邊界:Agent 必須避免什麼、先釐清什麼,或何時交回真人?
例如,這份工作可能是回答一個已核准的課程問題、引導老師找到下一個可行動步驟,或按照專業標準 review 一份草稿。請選一個你真的在工作中看過的情境。
你將完成什麼
完成本指南後,你會得到:
- 一個只針對這份工作設計的 Agent 第一版
- 一個能代表這份工作的真實情境,以及幾個位於處理邊界的相似情境
- 一組有清楚判斷條件、可以重跑,而且必須持續通過的案例
- 一個發布受控範圍,或繼續改善後再上線的明確決定
- 一套上線後處理新對話並從中學習的方法
一個測試通過,不代表商業、服務或學習成果已經成立。它只能提供你實際檢查過的 Agent 行為證據。
發布關卡仍由團隊負責
Test Suite 會保存案例與評估結果,Agent version history 會保存工作版本;但 Codeer 目前不會在必要案例失敗時自動阻擋發布,也不會把核准人與停止條件保存成發布紀錄。發布前,團隊仍需選定必須通過的案例、檢查證據,並依照只發布已驗證的範圍留下決策紀錄。
誰決定什麼
| 角色 | 在這份指南裡最主要的決定 |
|---|---|
| 專家/負責人 | 什麼才算做好、什麼不安全,以及哪些範圍可以發布 |
| 營運人員 | 哪些對話現在需要處理,以及哪些新情境應該保存成案例 |
| 管理員/實作者 | Agent 可以使用哪個工作空間、資料來源、Channel、權限與工具 |
同一個人可以兼任多個角色。即使是同一個人,也請把這些決定分開看待。
推薦的第一個工作流程
步驟 1:選擇工作空間與工作
當 Agent 應該共用同一批客戶、知識、營運人員與記憶範圍時,使用既有工作空間。當這些邊界需要隔離時,再建立新的工作空間。
打開 Agent Editor 前先寫好工作說明。如果結果與邊界還說不清楚,就用一個真實情境把它們具體化。
→ 設定工作空間
步驟 2:建立第一版
在工作空間中打開 AI 助理,再點擊 新增。
- 有適合的 Template 時,選擇
使用 Template。回答設定問題、產生草稿,並在建立 Agent 前檢查每個欄位。 - 沒有合適 Template 時,選擇
從空白開始。用一般語言描述工作、品質標準與邊界;Copilot 可以協助整理成第一版。
兩條路最後都會回到同一個 Agent Editor,接著使用同一套驗證步驟。
步驟 3:試跑真實情境
在 Live Test 執行工作說明裡的情境,再試幾個位於處理邊界的相似情境,例如缺少資訊、超出範圍的請求、高風險承諾,或應由真人接手的時機。
這個階段是在檢查第一個行為,不是在證明 Agent 已經適合所有使用者。
→ 建立並除錯第一版
步驟 4:保存必須持續通過的行為
把一定要持續正確的情境保存成 Test Suite 裡可以重跑的案例。每個案例都要有一個讓其他審查者不必猜測就能判斷的 Standard。
第一次看見價值時,一個真實情境加上幾個處理邊界的相似情境,就足以暴露設計問題。進入受控試行前,再按照發生頻率、錯誤後果、工具使用與交接風險擴大案例集;沒有所有 Agent 都適用的固定題數。
→ 已驗證情境
步驟 5:發布受控範圍
只有在專家或負責人已檢查必須持續通過的行為,以及未驗證工作要採用的替代處理方式之後,才發布 Agent。第一批使用者的人數應控制在營運人員能觀察並處理實際狀況的範圍內。
步驟 6:處理、學習並重新驗證
在 對話 查看實際發生的事情。需要真人時先處理,把值得保留的新判斷存成案例,只做最小且相關的修改,並在發布下一版前重跑受影響的案例。
→ 查看對話並改善
→ 回覆對話