Gemini 3.8 Flash TTS 是什麼?Google 全新語音合成模型解析 2026
2026年09月29日
Gemini 3.8 Flash TTS 與 Flash-Lite TTS 帶來 2,000 種以上音色、自然語言聲音設計與 30 秒樣本複刻。這篇說清楚 Google 語音合成模型能做什麼、不能做什麼。
Google DeepMind 在 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩顆語音合成模型,主打 2,000 種以上音色、用自然語言描述就能設計聲音,以及 30 秒樣本複刻。
先說最容易被搞混的地方:這跟 9 月 15 日的 Gemini 3.8 Live 不是同一件事。Live 處理的是即時對話,你一句我一句;TTS 處理的是把文字變成聲音,用在旁白、有聲書、客服語音這類場景。兩者都在 Gemini 3.8 這一代,但解決的問題完全不同。
這篇會講清楚 Gemini TTS 音色與能力的邊界、聲音設計怎麼運作、實際能在哪裡派上用場,以及它不適合拿來做什麼。如果你正在找一個 Gemini 語音模型來處理旁白或教材音訊,下面的判斷可以直接拿去用。
Gemini 3.8 Flash TTS 的核心規格
規格先擺出來。
| 項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 定位 | 品質與表現力優先 | 成本與延遲優先 |
| 音色數量 | 2,000 種以上 | 共用同一批音色 |
| 支援語言 | 100 種以上 | 100 種以上 |
| 聲音設計 | 自然語言提示詞 | 自然語言提示詞 |
| 樣本複刻 | 30 秒音訊 | 30 秒音訊 |
| 多說話人 | 支援雙說話人 | 支援雙說話人 |
兩顆模型的分工很清楚。Flash 版本把表現力做足,適合需要情緒、停頓、語氣的內容;Flash-Lite 把體積與延遲壓低,適合大量產生、對品質要求沒那麼高的場景。
2,000 種以上音色這個數字,不是 2,000 個預先錄好的聲音檔案。它是模型能生成的音色範圍,你透過描述去收斂到你要的那一個。理解這一點,後面的用法才說得通。
Google 語音合成模型怎麼用文字描述設計聲音
這一代最實用的改變,是你可以直接用自然語言請它做一個聲音。
過去的語音合成要先挑一個預設聲音,再調語速、音調這些旋鈕。能調的就那幾個,出來的結果大同小異。Gemini TTS 換了一種做法:你描述你要的角色,例如「中年男性、語速偏慢、帶著剛睡醒的沙啞」,模型去找符合這個描述的聲音出來。
這種方式就是所謂的自然語言聲音設計,在多角色內容製作上差別最大。一本有聲書如果需要五個不同的敘事者,過去可能要來回試聽幾十次才勉強湊齊;用描述生成,你可以明確指定每個角色的年齡、口音與情緒基調。
30 秒樣本複刻是另一條路。如果你手上已經有一個想延續的聲音,用 30 秒的音訊就能讓模型抓出音色特徵。行銷素材需要延續品牌旁白的調性時,這比重新找一個「聽起來差不多」的聲音更省事。
雙說話人支援讓一段音訊裡可以有兩個聲音對話。教學影片的問答、廣播劇的對白、產品示範裡的一搭一唱,都不需要再拼接兩段獨立生成的音檔。
100 種以上語言與多語言內容
Gemini TTS 覆蓋 100 種以上語言。對做多語內容的團隊來說,這代表同一套流程可以撐起好幾個市場。
要注意的是,跨語言的音色一致性並不自動成立。用同一段描述去生成中文與英文的旁白,出來的聲音聽起來是不是同一個人,取決於模型對該語言的聲音分佈。實務上通常要針對每個語言微調描述,而不是一句描述打天下。
對一般使用者來說,這個覆蓋範圍的實際意義是:你可以用熟悉的語言描述需求,讓模型產出其他語言的成品,中間不需要再找配音。對小團隊來說,這省下的是整條錄音與後製流程。
Gemini 3.8 Flash TTS 的實際使用場景
場景講抽象沒意義,講具體的。
做 YouTube 影片的人最常卡在旁白。自己錄要花時間、狀態不穩、重錄很煩;用合成語音又常被聽出來是機器。這一代的表現力如果到位,能用描述指定語氣與節奏,等於多了一個隨時待命的配音員。
App 開發者會用到的是動態提示音與語音回饋。導航應用要念出不斷變動的路名與地名,客服系統要播報訂單狀態。這類內容沒辦法預錄,只能即時生成,Flash-Lite 的低延遲就是為這種場景準備的。
教育與訓練內容也吃得下這個能力。課程錄音要改成多語言版本、企業內訓要產生不同角色的情境對話,這些都是過去外包錄音室的活。用自然語言描述每個角色,一次生成整段。
還有一種是無障礙應用。把長篇文件轉成自然語音,讓視障使用者用聽的方式取得內容,音色越自然,長時間聽下來的疲勞越低。
和其他語音合成方案放在一起看
市面上的語音合成大致分兩類:一類是傳統的 TTS,靠預錄音檔拼接或統計模型合成,音色固定、調節選項少;另一類是端到端的生成式模型,靠大量語音訓練直接生成波形。
Gemini 3.8 Flash TTS 屬於後者,而且把「用文字控制聲音」當成主要介面。這個選擇的好處是靈活,代價是控制精度不一定比得上參數化的工具。要精確調整某一個音節的長度,用文字描述並不容易。
跟 Gemini 3.8 Live 的關係也值得說清楚。Live 管即時對話,TTS 管離線生成,兩者的輸入輸出型態不同。有些應用會同時用到兩者,例如一個客服系統用 TTS 播報、用 Live 處理客戶的追問。
該注意的限制
生成式語音有幾個地方要留意。
幻覺在語音模型上不叫幻覺,但問題類似:模型可能把數字、專有名詞或罕見發音念錯。用在需要精確播出數字或法規名稱的場合前,最好先試聽。
音色複刻涉及授權問題。用 30 秒樣本複刻一個聲音之前,要確認你有權使用那段素材,尤其是複刻真人的聲音。這在各個市場的法律要求不同,別預設它沒問題。
成本與延遲要分開評估。Flash 版本音質好但比較貴,Flash-Lite 便宜但表現力有限。如果你的用量很大,兩者的月成本差距會很明顯。
還有一點是中文的處理。100 種以上語言是覆蓋範圍,但每個語言的表現不會一模一樣。多音字、破音字、中英夾雜的句子,這些是中文 TTS 的老問題,換成生成式模型不代表自動解決。
結論
Gemini 3.8 Flash TTS 把語音合成的操作介面從「調參數」換成「寫描述」,2,000 種以上音色加上 30 秒樣本複刻,讓沒有錄音資源的團隊也能做出像樣的配音。
如果你手上經常有旁白、教學音訊或多語內容要處理,這一代值得花時間試。實際做法是挑一段你本來要外包錄音的稿子,用自然語言寫下你要的聲音,比較一下成品差距在哪。
想試這類語音功能,可以先到 APKPure 下載最新版 Gemini 應用程式。使用前記得注意權限與隱私:麥克風與音訊上傳會把內容送到 Google 的伺服器處理,複刻他人聲音前也務必確認授權範圍,避免後續的版權問題。