←新聞 4 / 9→

產品發佈

如何在 ADK 中評估 Live 與 Voice Agents

How to Evaluate Live & Voice Agents in ADK

如何在 ADK 中評估 Live 與 Voice Agents

developers.googleblog.com · 2026-09-25

摘要

Google 在 ADK 中新增原生 Live Evaluation 功能,讓開發者能針對基於 Graph 的 Agent 工作流程進行自動化測試。該功能結合 Gemini TTS 生成真實語音,透過自然語言評分標準自動評估語音回應與工具執行結果,並支援在 CI/CD 管道中直接運行。

ADK 新增原生 Live 評估功能,強化語音 Agent 測試

過去 Agent 在示範環境表現得好好的,但實際上線後常常因為提示詞微調或模型換版,出現工具呼叫失敗、上下文遺失,或使用者插話被忽略等狀況。這個新功能讓開發者可以用模擬使用者進行多輪語音對話,自動評估語音回應和工具執行結果,確保 Agent 在真實互動中的表現穩定、且有可重複驗證的證據。

建構基於圖的工作流程 Agent

為了展示評估流程怎麼跑,官方提供一個基於圖(Graph)的範例,由三個單一目的的 Live Agent 依序串接組成,每個階段都跑在 `gemini-live-2.5-flash-native-audio` 模型上。工作流程包含三個角色:第一個是 `greeter_agent`,扮演護理團隊助手 Sam,負責打招呼、確認使用者是 John Doe;第二個是 `dob_verifier_agent`,負責詢問出生日期,讀出確認後呼叫 `validate_date_of_birth` 工具做驗證,並輸出驗證結果;最後是 `goals_agent`,在身份驗證通過後主動告知預約資訊,回答問題後結束對話。

這個工作流程透過 `Workflow` 類別把各個 Agent 串起來,控制權在 Agent 之間轉移時,使用者不會感覺到交接。ADK 會讓音訊串流保持開啟,把累積的會話狀態和對話歷史傳給下一個 Agent,讓每個 Agent 都能接續完整上下文繼續運作,而不是從零開始。這種設計會產生豐富的多輪對話軌跡,很適合拿來做全面的評估測試。

編寫評估集與模擬使用者設定

評估集(Eval Set)是 JSON 檔案,裡面有兩種測試案例:對話場景,以及固定對話。對話場景讓開發者描述目標和角色,交給使用者模擬器自由發揮。舉例來說,把 `user_persona` 設成 `NOVICE`,模擬器就只會分享高層級目標,等 Agent 主動詢問細節,藉此測試 Agent 引導對話的能力。為了避免對話無限延伸下去,可以用 `max_allowed_invocations` 設定最大回合數。

另一種是固定對話,開發者可以逐字寫死使用者每一輪的回應。這種靜態案例一樣可以直接餵給 Live 模式運行。兩種方式都能把測試案例和執行方式分開處理,開發者可以視情況選用。

啟用 Live 模式與語音合成配置

在 `test_config.json` 裡,開發者要加上 `live_model_config` 才能啟用 Live 模式;如果省略這段設定,測試就會以標準文字模式跑。ADK 用 `llm_audio` 使用者模擬器,把每個使用者回合透過 Gemini TTS 合成語音後串流給 Live Agent。設定裡要分清楚 `model` 和 `audio_model`:前者負責模擬使用者的對話邏輯,後者負責把文字合成語音。

開發者可以調整 `voice_name` 和 `language_code`,測試不同語音、口音下 Agent 的表現。評估標準透過 `criteria` 設定,支援以條文為基礎(Rubric-based)的 LLM 裁判,用 `gemini-3.7-flash` 當裁判模型。自然語言條文可以像人類審查員一樣判斷意圖,適合用在多 Agent 圖的端到端評估,也可以另外加每回合指標,用來評分個別回應或工具執行狀況。

執行評估與結果檢視

開發者可以用 CLI 執行評估,指令是 `uv run adk eval`,並指定工作目錄、評估集檔案和設定檔。執行前要先裝好 `eval` 這個額外套件,並設定好 Live API 和 Gemini TTS 的 API 憑證。這套流程也可以透過 `AgentEvaluator` 用程式呼叫,方便整合進 CI/CD,在發布前就抓出回歸問題。

評估跑完後,ADK Web 介面原生就能檢視 Live 評估結果。在運行設定對話框裡選擇 Live 模式,可以調整輸入模態和語音設定。ADK 會把 Live 音訊串流重建成清楚的逐字稿,每一輪對話用獨立的訊息氣泡呈現,裡面有轉錄文字,也內嵌了可播放的音訊片段。開發者不只能看內容,還能直接聽 Agent 講話的語音表現,方便互動式除錯和品質驗證。

●開發者:可透過 ADK 原生功能自動化測試語音 Agent 的穩定性與準確性

●投資人:Google 持續強化 Gemini 生態系與開發者工具鏈的完整性

●一般用戶:未來使用語音 AI 助手時,其回應品質與穩定度有望提升

重要性評分

73/100

🟠 值得關注

ADKGemini TTSVoice Agents自動化測試Google Developers
原文出處
上一則← Google Cloud API Gateway 支援將 REST API 轉換為 MCP 工具下一則OpenAI AI 代理自主駭入澳洲政府醫療網站,總理艾班尼斯重話批評 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。