產品發佈
Google 推出 Gemini 3.8 TTS 文字轉語音系列!支援 30 秒複製人聲、自創聲線、逐句控制演繹風格
Google 推出全新 Gemini 3.8 TTS 系列文字轉語音模型!支援 30 秒複製人聲、自創聲線、逐句控制「怎麼演」

www.kocpc.com.tw · 2026-09-24
摘要
Google 發布全新 Gemini 3.8 TTS 模型系列,使用者只需 30 秒音檔即可複製特定人聲,或透過自然語言提示創造全新聲線。該技術支援逐句細緻控制語氣與演繹方式,適用於遊戲、沉浸式有聲書、Podcast 等多元場景,大幅降低專業配音成本與製作門檻。
Google 發表新一代文字轉語音模型 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,距離前代 Gemini 3.1 Flash TTS 推出約五個月。這次除了提升文字轉語音的自然度與控制能力,還加入多項新功能,包括只需 30 秒錄音就能複製指定人聲。根據 Hume AI 的 Voice Design 語音設計評測排行榜,Gemini 3.8 Flash TTS 以 71.4 分暫居第一。
聲音生成與複製功能
這次升級分成兩大方向:「做出聲音」與「指揮聲音」。聲音生成部分,使用者可以用自然語言描述角色、口音和聲音特徵,模型會據此生成全新聲音,支援超過 100 種語言與方言。不想自己設計的使用者,也能從聲音庫直接選現成聲音。聲音庫規模從原本 30 種擴大到 2,000 多種,涵蓋墨西哥西班牙語、魁北克法語、蘇格蘭英語等地區口音。
人聲複製功能方面,使用者只需提供 30 秒錄音,就能複製出一個穩定的聲音。為防止濫用,Google 設置了同意驗證機制——使用者必須另外上傳聲音主人親口表示同意的錄音,系統確認該錄音與參考錄音來自同一人後,才會建立該聲音。
設計或複製的聲音可以保存管理,根據 Gemini API 開發文件,每個專案最多可存 200 個自訂聲音,保存期限為 1 年。Google 也提到一項「即將推出」的聲音混音功能,使用者可從聲音庫選聲音,再透過提示詞微調音色、音高、語速與口音,例如「加一點美國南方口音」或「講得溫柔一點」。
逐句細緻控制演繹風格
「指揮聲音」功能允許為每一句台詞寫舞台指示,或讓 Gemini 根據劇本自動判斷演繹方式,從冷靜的客服語氣到壓低聲音的懸疑場景都能做到。相比前代依賴 200 多種音訊標籤的做法,新模型改成「直接寫一段表演指導提示詞」,控制方式更自然。
新模型可連續生成數小時音訊,並維持音質、節奏與角色音色的一致性,甚少出現講者聲音漂移的情況,適合製作 Podcast 與有聲書。此外,該模型原生支援雙人對話,單份腳本就能產生多輪兩人對話,兩個聲音區隔清晰,換人講話的節奏也相當自然。
測試表現與安全機制
在 Hume AI 的 Voice Design 排行榜中,Gemini 3.8 Flash TTS 英文總分達 71.4 分,超越 ElevenLabs 的 70.8 分與 Inworld 的 69.8 分。口音生成方面差距最明顯,Gemini 得 60.8 分,ElevenLabs 只有 45.4 分、Inworld 35.8 分,顯示 Gemini 在生成特定口音(如墨爾本腔、蘇格蘭腔)上的優勢。多語言項目中,Gemini 同樣小幅領先(3.82 對 3.65)。
Hume AI 品質評測中,Gemini 3.8 Flash TTS 總分達 0.920、Flash-Lite TTS 達 0.914,相較前代 Gemini 3.1 Flash TTS 的 0.783 進步幅度明顯,並領先所有競爭對手。多人對話與風格標籤控制也都排第一。唯一落後的地方是「Human-like variation」項目,這項評估語音輸出間的變化是否接近真人說話的自然變化,ElevenLabs v3 拿到滿分 5.00,Gemini 為 4.58。
Voice Arena 真人盲測中,Gemini 3.8 Flash TTS 在日語表現最出色,得分 1,232(前代 3.1 為 1,148、ElevenLabs v3 為 1,048);阿拉伯語也達 1,204 分。比較特別的是,英語、巴西葡萄牙語、越南語反而是成本較低的 Flash-Lite 版本拿下最高分。
安全性方面,除了前面提到的同意驗證,Gemini Audio 模型生成的每段音訊都會嵌入 Google 的 SynthID 浮水印。人耳無法察覺這個浮水印,但可以用來辨識聲音是否由 AI 生成。聲音複製功能另外支援 C2PA 內容憑證。
可用性與定價
Gemini 3.8 Flash TTS 即日起陸續上線,開發者可在 Gemini API 與 Google AI Studio 使用,一般使用者也能在 Gemini Notebook 中體驗。有興趣的人可到 Google AI Studio 免費試用。
API 定價方面,兩款模型到 2026 年 12 月 31 日前提供優惠價格。以百萬 Token 計,Gemini 3.8 Flash TTS 文字輸入 0.5 美元、音訊輸出 9 美元、批次處理 4.5 美元;Gemini 3.8 Flash-Lite TTS 文字輸入 0.5 美元、音訊輸出 6 美元、批次處理 3 美元。自 2027 年 1 月 1 日起,音訊輸出價格將調回原價,Gemini 3.8 Flash TTS 調至 18 美元、Flash-Lite TTS 調至 12 美元。
●開發者:可整合高度可控的 TTS API 開發創意應用
●投資人:語音生成市場競爭加劇,Google 強化 AI 應用生態
●一般用戶:內容創作者與遊戲開發者能以更低成本製作高品質音訊內容
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe Jev 實際上手:三個真實情境,看「只做判斷的 AI」能替你省掉哪些 if
拿到帳號後,我們用日報管線的真實資料把 TypeSafe Jev 跑了一輪:新聞分類、社群選題、讀者來信路由,外加幾個它做不到的邊界測試。附每一題的實際機率、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。