新聞 11 / 12

產品發佈

Google 推出 Gemini 3.8 TTS 文字轉語音系列!支援 30 秒複製人聲、自創聲線、逐句控制演繹風格

Google 推出全新 Gemini 3.8 TTS 系列文字轉語音模型!支援 30 秒複製人聲、自創聲線、逐句控制「怎麼演」

Google 推出 Gemini 3.8 TTS 文字轉語音系列!支援 30 秒複製人聲、自創聲線、逐句控制演繹風格

www.kocpc.com.tw · 2026-09-24

摘要

Google 發布全新 Gemini 3.8 TTS 模型系列,使用者只需 30 秒音檔即可複製特定人聲,或透過自然語言提示創造全新聲線。該技術支援逐句細緻控制語氣與演繹方式,適用於遊戲、沉浸式有聲書、Podcast 等多元場景,大幅降低專業配音成本與製作門檻。

Google 發表新一代文字轉語音模型 Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS,距離前代 Gemini 3.1 Flash TTS 推出約五個月。這次除了提升文字轉語音的自然度與控制能力,還加入多項新功能,包括只需 30 秒錄音就能複製指定人聲。根據 Hume AI 的 Voice Design 語音設計評測排行榜,Gemini 3.8 Flash TTS 以 71.4 分暫居第一。

聲音生成與複製功能

這次升級分成兩大方向:「做出聲音」與「指揮聲音」。聲音生成部分,使用者可以用自然語言描述角色、口音和聲音特徵,模型會據此生成全新聲音,支援超過 100 種語言與方言。不想自己設計的使用者,也能從聲音庫直接選現成聲音。聲音庫規模從原本 30 種擴大到 2,000 多種,涵蓋墨西哥西班牙語、魁北克法語、蘇格蘭英語等地區口音。

人聲複製功能方面,使用者只需提供 30 秒錄音,就能複製出一個穩定的聲音。為防止濫用,Google 設置了同意驗證機制——使用者必須另外上傳聲音主人親口表示同意的錄音,系統確認該錄音與參考錄音來自同一人後,才會建立該聲音。

設計或複製的聲音可以保存管理,根據 Gemini API 開發文件,每個專案最多可存 200 個自訂聲音,保存期限為 1 年。Google 也提到一項「即將推出」的聲音混音功能,使用者可從聲音庫選聲音,再透過提示詞微調音色、音高、語速與口音,例如「加一點美國南方口音」或「講得溫柔一點」。

逐句細緻控制演繹風格

「指揮聲音」功能允許為每一句台詞寫舞台指示,或讓 Gemini 根據劇本自動判斷演繹方式,從冷靜的客服語氣到壓低聲音的懸疑場景都能做到。相比前代依賴 200 多種音訊標籤的做法,新模型改成「直接寫一段表演指導提示詞」,控制方式更自然。

新模型可連續生成數小時音訊,並維持音質、節奏與角色音色的一致性,甚少出現講者聲音漂移的情況,適合製作 Podcast 與有聲書。此外,該模型原生支援雙人對話,單份腳本就能產生多輪兩人對話,兩個聲音區隔清晰,換人講話的節奏也相當自然。

測試表現與安全機制

在 Hume AI 的 Voice Design 排行榜中,Gemini 3.8 Flash TTS 英文總分達 71.4 分,超越 ElevenLabs 的 70.8 分與 Inworld 的 69.8 分。口音生成方面差距最明顯,Gemini 得 60.8 分,ElevenLabs 只有 45.4 分、Inworld 35.8 分,顯示 Gemini 在生成特定口音(如墨爾本腔、蘇格蘭腔)上的優勢。多語言項目中,Gemini 同樣小幅領先(3.82 對 3.65)。

Hume AI 品質評測中,Gemini 3.8 Flash TTS 總分達 0.920、Flash-Lite TTS 達 0.914,相較前代 Gemini 3.1 Flash TTS 的 0.783 進步幅度明顯,並領先所有競爭對手。多人對話與風格標籤控制也都排第一。唯一落後的地方是「Human-like variation」項目,這項評估語音輸出間的變化是否接近真人說話的自然變化,ElevenLabs v3 拿到滿分 5.00,Gemini 為 4.58。

Voice Arena 真人盲測中,Gemini 3.8 Flash TTS 在日語表現最出色,得分 1,232(前代 3.1 為 1,148、ElevenLabs v3 為 1,048);阿拉伯語也達 1,204 分。比較特別的是,英語、巴西葡萄牙語、越南語反而是成本較低的 Flash-Lite 版本拿下最高分。

安全性方面,除了前面提到的同意驗證,Gemini Audio 模型生成的每段音訊都會嵌入 Google 的 SynthID 浮水印。人耳無法察覺這個浮水印,但可以用來辨識聲音是否由 AI 生成。聲音複製功能另外支援 C2PA 內容憑證。

可用性與定價

Gemini 3.8 Flash TTS 即日起陸續上線,開發者可在 Gemini API 與 Google AI Studio 使用,一般使用者也能在 Gemini Notebook 中體驗。有興趣的人可到 Google AI Studio 免費試用。

API 定價方面,兩款模型到 2026 年 12 月 31 日前提供優惠價格。以百萬 Token 計,Gemini 3.8 Flash TTS 文字輸入 0.5 美元、音訊輸出 9 美元、批次處理 4.5 美元;Gemini 3.8 Flash-Lite TTS 文字輸入 0.5 美元、音訊輸出 6 美元、批次處理 3 美元。自 2027 年 1 月 1 日起,音訊輸出價格將調回原價,Gemini 3.8 Flash TTS 調至 18 美元、Flash-Lite TTS 調至 12 美元。

開發者:可整合高度可控的 TTS API 開發創意應用

投資人:語音生成市場競爭加劇,Google 強化 AI 應用生態

一般用戶:內容創作者與遊戲開發者能以更低成本製作高品質音訊內容

重要性評分

78/100

🟠 值得關注

文字轉語音Gemini 3.8聲線合成
原文出處
上一則委派錯位對齊:多智能體結構如何擴大 LLM 安全風險下一則Google 推出 Tunix 自動化 LLM 後訓練框架,在 TPU 上實現端到端微調

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。