文字轉語音
當 Agent 需要在對話中把文字回答轉成語音時,使用 Text to Speech。
這個工具適合用在使用者希望用聽的、不想只閱讀文字,或你的 channel 體驗本來就需要語音後續訊息的情境。
什麼時候適合用 Text to Speech
適合用在:
- 使用者明確要求音訊版本
- 回答內容已經穩定,可以被讀出來
- 用聽的比閱讀更適合這個情境
不要用在:
- Agent 還在收集事實或判斷要說什麼
- 使用者只需要一般文字回答
- 內容包含秘密、付款資料,或其他不適合轉成音訊的敏感資訊
Step 1:加入 Text to Speech
在 Editor 打開 Tools,按 Add Tool,然後選擇 Text to Speech。
Step 2:選擇語音模型
選擇這個 Agent 要使用的 ElevenLabs 語音模型。
如果模型清單是空的,代表 workspace 或環境可能還沒有完成 ElevenLabs 設定。請先請管理員確認 provider 設定,再測試這個工具。
Step 3:選擇語言行為
除非你想固定語音語言,否則 Language 可以維持自動判斷。
固定語言適合用在:
- Agent 永遠應該用同一個目標語言說話
- 使用者可能用多種語言輸入,但音訊輸出要保持一致
- 教學、陪練或客服流程需要降低語音語言的變動
Step 4:選擇聲音
Voice Gender 只是用來縮小候選清單。真正影響輸出的是你最後選擇的 Voice。
選好聲音後,如果有 preview sample,請先播放確認。即使 preview sample 是另一種語言,多語言模型仍可能可以用你選擇的語言生成音訊。
Step 5:寫清楚 When to Use
把語音生成當成刻意選擇的輸出模式,而不是預設回答方式。
範例:
Use this tool when the user asks to hear the answer as audio, or when the agent has finished a stable explanation that would be easier to review by listening. Do not use it while collecting sensitive information or when a normal text reply is enough.
這樣寫有三個好處:
- 說清楚哪些使用者要求會觸發音訊
- 說清楚對話進行到哪裡才適合產生音訊
- 說清楚哪些情況應該保持文字回答
Step 6:用需要音訊的 prompt 測試
可以測這類 prompt:
Can you read that answer out loud for me?Please give me an audio version of the next-step summary.
然後確認:
- 只有在音訊明確有用時才會呼叫工具
- 選擇的聲音與語言符合預期體驗
- Agent 仍然先產生正確文字回答,再搭配語音行為
操作建議
- 觸發條件要窄,不要讓 Agent 每一則回答都產生音訊。
- 對外分享 Agent 前,先選一個符合服務語氣的聲音。
- 不要把一次性秘密、驗證碼、付款卡號或其他應該保持文字形式的內容轉成音訊。
- 如果使用者上傳音訊附件,Agent 的 LLM 模型仍然必須支援 audio input。這個工具控制的是語音輸出,不會讓所有模型都能理解音訊輸入。
常見錯誤
把語音當成預設回答方式
如果每一則回答都變成音訊,對話會變慢,也更難快速掃讀。只有在情境真的受益於音訊時才使用。
沒測過聲音就發布
如果有 sample,請先 preview,再用真實 prompt 測一次。
混淆音訊輸出與音訊輸入
Text to Speech 是把文字轉成語音。音訊上傳與音訊附件仍然要看模型與 channel 是否支援,請搭配 LLM 模型選擇 閱讀。