新聞 3 / 11

產品發佈

Google DeepMind 推出 Gemini 3.8 Live 與 3.8 Live Extended Thinking

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

Google DeepMind 推出 Gemini 3.8 Live 與 3.8 Live Extended Thinking

deepmind.google · 2026-09-15

摘要

Google DeepMind 正式發布 Gemini 3.8 Live 版本,並同步推出支援 Extended Thinking(延伸思考)能力的更新。此更新強化了模型在處理複雜任務時的推理深度與即時互動體驗,為開發者與使用者提供更強大的 AI 輔助能力。

Google DeepMind 發布 Gemini 3.8 Live 系列模型

Google DeepMind 宣布推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款新模型,號稱是目前最先進的即時對話模型。這次更新提升了智慧程度與平行推理能力,讓使用者處理複雜任務時,可以透過語音得到更直覺、流暢的協作體驗。兩款模型都支援即時視覺情境處理、背景任務執行,並能在不中斷對話的情況下進行多步驟推理,目前已可透過 Gemini API、Google Workspace 以及 Gemini 應用程式使用。

性能指標與基準測試表現

技術表現上,Gemini 3.8 Live Extended Thinking 定位為處理高複雜度任務的方案,具備增強的智慧與多步驟推理能力。根據 Artificial Analysis 的 Speech to Speech Quality Index 評分,這款模型拿下 82.6 分,整體排名第一。在 τ-Voice 基準測試中,代理任務完成率達到 68.6%;Sierra 的 τ-Voice-banking 基準測試則是 35.1%。另外,這款模型在 Big Bench Audio 測試拿下 97.7% 的高分,推理能力強,價格也有競爭力。

Gemini 3.8 Live 在 Speech Agent Arena 拿下第二名,顯示使用者偏好度高。這款模型在 ServiceNow 的 EVA-Bench 基準測試中,在複雜工作流的準確率與對話品質之間取得平衡,推動了帕累托前沿(Pareto Frontier)往前發展。對開發者與企業來說,這些模型提供了可靠、能直接投入生產環境的語音代理基礎構件,在規模化與成本效益上表現不錯。

核心功能:即時視覺、多語言與背景執行

Gemini 3.8 Live 能近乎即時處理視覺輸入,為對話提供更豐富的上下文,進而給出更有幫助的回應。這款模型支援對話中自動偵測並切換 97 種語言,確保跨語言溝通順暢。另一個關鍵功能是背景工具執行:當模型需要呼叫 API 或執行工具時,可以在後台處理,同時繼續跟使用者對話,不會因為等待結果而讓對話中斷。

針對需要更深層推理的場景,Gemini 3.8 Live Extended Thinking 能一邊推理一邊說話。它會用早期的語音提示(例如「讓我查一下…」)自然回應使用者,並透過即時進度敘述,讓使用者知道多步驟背景任務進行到哪裡。這樣的設計讓模型處理複雜工作流時,既能維持高智慧水準,對話也不會卡頓。

應用場景與生態系整合

實際應用上,Google 展示了幾個使用案例。Gemini 3.8 Live 可以用在即時員工入職引導,透過視覺上下文回答現場問題,或是近乎即時地透過視覺上下文進行西洋棋對弈。Gemini 3.8 Live Extended Thinking 則能把原始草圖與近乎即時的語音反饋轉換成功能性的 React 元件,或協調多步驟的預訂與非同步函數呼叫,整個過程不會打斷自然對話。此外,這款模型還能透過自然語音即時做出完整的商業計畫與客製化行銷工具包。

在 Google 產品生態系裡,使用者可在 Google Workspace 的 Docs Live、Gmail Live 與 Keep Live 體驗 Extended Thinking 功能,用來做每日摘要、收件匣管理或待辦事項交接。Search Live 則提供由 Gemini 3.8 Live 驅動的即時除錯協助。對開發者來說,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 等平台已經整合 Gemini Live API,協助開發者建構高性能的語音驅動介面 —— 這些平台負責處理複雜的即時媒體串流基礎設施,開發者可以專心打造使用者體驗。

安全標記與發布時程

為確保內容透明,所有 Google AI 產品生成的語音都內建 SynthID 不可見水印。這個水印直接編織在語音輸出中,讓 AI 生成內容可被偵測,有助防止誤導性資訊擴散。詳細的安全與責任資訊可參考模型說明文件。

發布時程方面,Gemini 3.8 Live 自即日起開放使用。開發者可透過 Gemini API 與 Google AI Studio 存取;企業客戶可在 Gemini Enterprise 的私人預覽中體驗,並即將推出至 Gemini Enterprise for Customer Experience;一般使用者則可在 Search Live 試用。Gemini 3.8 Live Extended Thinking 同樣自即日起開放,開發者與企業客戶的存取管道跟前者相同,但企業客戶還會拿到 Google Workspace 商業客戶的支援。一般使用者可在 Gemini Live 體驗,Google AI Pro 與 Ultra 訂閱用戶可在 Workspace 的 Docs 中使用,所有 Google AI 訂閱用戶則可在 Gmail 與 Keep 中使用這項功能。

開發者:可關注 Gemini 3.8 Live 的 API 整合與 Extended Thinking 應用場景

投資人:Google 在生成式 AI 模型迭代上持續領先,關注其商業化進展

一般用戶:將能體驗更深度思考與即時互動的 AI 服務

重要性評分

75/100

🟠 值得關注

GeminiGoogle DeepMindExtended ThinkingAI 模型更新生成式 AI
原文出處
上一則Anthropic 公開 Claude 全球濫用威脅報告下一則AWS 週報:OpenAI GPT-6 Astra 登陸 Amazon Bedrock、Amazon Quick desktop GA

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。