產品發佈
Google DeepMind 推出 Gemini 3.8 Live 與 3.8 Live Extended Thinking
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

deepmind.google · 2026-09-15
摘要
Google DeepMind 正式發布 Gemini 3.8 Live 版本,並同步推出支援 Extended Thinking(延伸思考)能力的更新。此更新強化了模型在處理複雜任務時的推理深度與即時互動體驗,為開發者與使用者提供更強大的 AI 輔助能力。
Google DeepMind 發布 Gemini 3.8 Live 系列模型
Google DeepMind 宣布推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款新模型,標榜為目前最先進的即時對話模型。此次更新提升了智慧與平行推理能力,讓使用者處理複雜任務時能透過語音獲得更直覺流暢的協作體驗。這兩款模型支援即時視覺情境處理、背景任務執行,以及在不中斷對話的前提下進行多步驟推理,目前已可透過 Gemini API、Google Workspace 以及 Gemini 應用程式使用。
性能指標與基準測試表現
技術表現方面,Gemini 3.8 Live Extended Thinking 定位為處理高複雜度任務的方案,具備增強的智慧與多步驟推理能力。根據 Artificial Analysis 的 Speech to Speech Quality Index 評分,該模型以 82.6 分拿下整體第一名。在 τ-Voice 基準測試中,其代理任務完成率達到 68.6%,Sierra 的 τ-Voice-banking 基準測試則為 35.1%。此外,該模型在 Big Bench Audio 測試中拿到 97.7% 的高分,展現強大推理能力,同時維持具競爭力的價格。
Gemini 3.8 Live 則在 Speech Agent Arena 拿下第二名,顯示使用者偏好度高。該模型在 ServiceNow 的 EVA-Bench 基準測試中,在複雜工作流的準確率與對話品質之間取得平衡,推動了帕累托前沿(Pareto Frontier)的發展。對開發者與企業來說,這些模型提供了可靠、可直接投入生產環境的語音代理基礎構件,在規模化與成本效益方面表現優異。
核心功能:即時視覺、多語言與背景執行
Gemini 3.8 Live 能在近乎即時的情況下處理視覺輸入,為對話提供豐富上下文,生成更有幫助的回應。該模型支援在對話過程中自動偵測並切換 97 種語言,確保跨語言溝通順暢。另一項關鍵功能是背景工具執行能力:當模型需要呼叫 API 或執行工具時,可以在後台處理這些任務,同時繼續與使用者對話,不會因等待結果而中斷對話流程。
針對需要更深層推理的場景,Gemini 3.8 Live Extended Thinking 能在推理與說話的同時進行。它會用早期的語音提示(例如「讓我查一下…」)自然回應使用者,並透過即時進度敘述,讓使用者了解多步驟背景任務的進展。這樣的設計讓模型處理複雜工作流時,既能保持高智慧水準,又能維持無縫的對話流暢度。
應用場景與生態系整合
實際應用上,Google 展示了多個使用案例。Gemini 3.8 Live 可用於即時員工入職引導,透過視覺上下文回答現場問題,也能在近乎即時的狀態下透過視覺上下文進行國際象棋對弈。Gemini 3.8 Live Extended Thinking 則能將原始草圖與近乎即時的語音反饋轉換為功能性的 React 元件,或協調多步驟的預訂與非同步函數呼叫,全程不干擾自然對話。此外,該模型還能透過自然語音即時建立完整的商業計畫與客製化行銷工具包。
在 Google 產品生態系中,使用者可在 Google Workspace 的 Docs Live、Gmail Live 與 Keep Live 中體驗 Extended Thinking 功能,進行每日摘要、收件匣管理或待辦事項移交。Search Live 則可獲得由 Gemini 3.8 Live 驅動的即時除錯協助。對開發者來說,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 等平台已整合 Gemini Live API,協助開發者建構高性能的語音驅動介面,這些平台負責處理複雜的即時媒體串流基礎設施,讓開發者能專注在使用者體驗上。
安全標記與發布時程
為確保內容透明度,所有由 Google AI 產品生成的語音均內建 SynthID 不可見水印。此水印直接編織於語音輸出中,讓 AI 生成內容可被偵測,有助於防止誤導性資訊。詳細的安全與責任資訊可參考模型說明文件。
發布時程方面,Gemini 3.8 Live 自即日起開放使用。開發者可透過 Gemini API 與 Google AI Studio 存取;企業客戶可在 Gemini Enterprise 的私人預覽中體驗,並即將推出至 Gemini Enterprise for Customer Experience;一般使用者則可在 Search Live 中試用。Gemini 3.8 Live Extended Thinking 同樣自即日起開放,開發者與企業客戶的存取管道與前者相同,但企業客戶還將獲得 Google Workspace 商業客戶的支援。一般使用者可在 Gemini Live 中體驗,Google AI Pro 與 Ultra 訂閱用戶可在 Workspace 的 Docs 中使用,所有 Google AI 訂閱用戶則可在 Gmail 與 Keep 中使用此功能。
●開發者:可關注 Gemini 3.8 Live 的 API 整合與 Extended Thinking 應用場景
●投資人:Google 在生成式 AI 模型迭代上持續領先,關注其商業化進展
●一般用戶:將能體驗更深度思考與即時互動的 AI 服務
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Gemini 教學:4 步生成 AI 手繪旅遊地圖與實戰應用
透過 Gemini 教學 4 步生成 AI 手繪旅遊地圖,掌握從概念到實作的完整流程。本文涵蓋 Gemini Developer API 定價分析、Google AI Studio 與 Gemini Canvas 對比,以及生成式 AI 在旅遊規劃中的實戰應用技巧。
閱讀指南 →
Gemini Spark 教學:繁中完整上手指南(功能、定價、實測)
Gemini Spark 教學完整指南,深入解析 Gemini Spark 是什麼、怎麼用,並提供繁中介面設定、免費方案詳解與實測效能分析,助您快速上手。
閱讀指南 →
Gemini 2.5 Pro 怎麼免費使用?功能介紹與 ChatGPT 比較
Gemini 2.5 Pro 怎麼免費用?本文說明 Google Gemini 的開啟步驟、免費版和 Advanced 付費版的功能差異,以及 Gemini 2.5 Pro 和 ChatGPT 在哪些場景各有優勢。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。