Gemini 3.8 Live 是什麼?Google 全新語音模型完整解析 2026

2026年09月17日
Google 於 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,主打邊說邊推理、即時視覺與背景工具執行。這篇說清楚 Gemini 語音模型到底改變了什麼。
Google 在 9 月 15 日一次丟出兩個語音模型,直接進了數百萬支 Android 手機的首頁畫面。這兩個模型分別是 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,來自 Google DeepMind 的 Gemini Audio 團隊,訴求只有一句:跟你講話的方式,要像跟人講話。
如果你曾經對著手機問問題,然後卡在那段「它正在思考」的空白裡,這次更新就是衝著你來的。對話不再被切斷,機器在背景把事做完,你繼續聊你的。
Gemini 3.8 Live 到底是什麼
先講清楚定位。Gemini 3.8 Live 是為規模與成本而生的那一顆,把對話智慧、流暢對答與視覺理解綁在一起。說白話,它能跟你來回聊,也能一邊聊一邊看你鏡頭拍到的東西。
另一顆 Gemini 3.8 Live Extended Thinking 是重量級。它在講話的同時跑多步推理,遇到複雜請求不會突然安靜,而是邊處理邊回你。
兩顆都屬於 Gemini Audio 系列,架構上奠基於 Gemini 3 Pro。輸入接收音訊、圖像、影片與文字,詞元上下文視窗最高 128K,輸出視窗 64K。這個上下文比表面看起來重要。一段聊食譜、聊文件、聊修理流程的長對話會留在記憶裡,不會講到一半掉出視窗。
這裡沒有開放權重的下載檔。它們是託管模型,你得透過 Google 的伺服器使用,不是塞在手機裡跑。這件事也決定了隱私輪廓:你的語音是送到 Google 處理的,不是交給存在本機的模型。選方案前先想清楚這一點。
Gemini 語音模型是怎麼把對話接起來的
舊架構像接力賽。第一個系統負責聽,把你說的話轉成文字。第二個語言模型讀逐字稿,寫出回覆。第三個系統再把回覆唸出來。三套系統串在一起,每一次交接都加一段延遲,而且前面一個小小的轉錄錯誤,會在答案從喇叭出來之前滾成完全走鐘的結果。
Gemini 3.8 Live 把接力棒丟了。它直接聽音訊、直接產生音訊,一次動作完成,所以對話聽起來接近打電話,而不是對講機。
實際好處落在三件事上。第一,它幾乎即時處理你鏡頭對準的東西,所以能針對眼前那個物件講話。第二,它會在對話中途自動偵測並切換 97 種支援語言,回話時還會維持你的口音。第三,它在背景執行工具與 API 呼叫,所以可以說一句「等我一下」,然後繼續跟你聊,直到任務收尾。
最後這項行為是真正的轉折點。模型收到請求、維持對話不斷、任務結束再收線。沒有冷場。
Gemini 3.8 Live Extended Thinking 差在哪裡
Extended Thinking 的差別是「同時推理、同時說話」。聽起來只是小調整,其實不是。舊的推理模型只有兩條路:答得快但淺,或是沉默很久去想。
它改用早期的口頭提示來守住發話權。會先說一句「我查一下」,然後在跑多步任務的過程中一步步敘述進度。對於要花超過幾秒的工作,這段碎念就是你選擇信任系統、還是放棄對話的分界線。
Google 自己的示範裡,它把一張手繪加上口頭回饋變成可運作的 React 元件,也協調了一次多步驟預約。這些偏開發者場景,但對一般使用者的暗示很清楚:你描述需求,邊講邊修,中間那段它接手。
基準數字撐得起這個野心。Extended Thinking 在 Artificial Analysis 的語音對語音品質指數拿下整體第一,分數 82.6。代理任務完成度在 τ-Voice 拿到 68.6%,在 Sierra 的 τ-Voice-banking 拿到 35.1%,Big Bench Audio 則是 97.7%。基礎版 Gemini 3.8 Live 則在語音代理競技場(Speech Agent Arena)這種人類偏好測試裡排第二。
今天在 Android 上哪裡用得到 Gemini 3.8 Live
上線就在發表當天開始,覆蓋範圍比開發者預覽大得多。
一般使用者這邊,Gemini 3.8 Live 撐起了 Google 應用程式裡的 Search Live。你開口問,回來的是一段口語對話,不是一頁連結。Extended Thinking 正在推送到 Gemini Live,對 Google AI Pro 與 Ultra 訂閱者還延伸到 Workspace 的 Docs,Google AI 訂閱者則涵蓋 Gmail 與 Keep。
這個鋪開範圍值得停下來看一下。同一顆語音模型,一邊跑一般聊天,一邊處理 Gmail 裡的對話式搜尋和 Keep 的筆記建立。如果你付費訂了 Google AI 方案,早上打開的那些應用程式裡,語音工具會跟著變聰明。
開發者則透過 Gemini Live API 與 Google AI Studio 使用這兩顆模型。音訊輸入每分鐘 0.005 美元,音訊輸出每分鐘 0.018 美元。
Gemini Live 語音代理在 Android 上的實際場景
抽象能力講起來很容易。放到手上是這樣。
設想你拿著手機,鏡頭對著家電上那串看不懂的錯誤代碼,直接開口問它什麼意思。模型讀出螢幕、解釋故障,再帶你走完一次排除流程,全程一個對話搞定。不用截圖,不用打字。
再想像廚房裡你兩隻手都是麵團。你問能不能換掉某個材料,模型回答,你再追問,它還記得你兩分鐘前提過的那份食譜。128K 的上下文就是那條線沒斷的原因。
或者換成在公園散步、環境有點吵。你想知道怎麼走到某個地標,順便聽一句它的來歷。語音代理一輪就回你,背景的工具呼叫去撈地圖資料,完全沒有打斷對話。
共同點是免持、不用眼睛。這正是真正的語音轉語音模型勝過文字介面的地方,也是 Google 把這些模型推向手機、而不是鍵盤的理由。
Gemini 3.8 Live 的優點與限制
你會得到的:
- 自然的節奏,能接住插話與打斷
- 即時視覺,模型可以討論鏡頭裡的東西
- 一段對話內自動切換 97 種語言
- 背景工具執行,讓對話不中斷
- 一般使用者就能在 Search Live 與 Gemini Live 用到,不只是開發者
你該留意的:
- 模型卡把幻覺,以及偶發的緩慢或逾時列為已知限制
- 知識截止日是 2025 年 1 月,太新的事件可能得靠即時工具呼叫補上
- 音訊輸出帶有 SynthID 浮水印,AI 生成的片段可被偵測
- 這是託管模型,沒有自行架設的選項
幻覺那一點不是附註。語音助理聽起來比文字框更有權威感,而這種自信會讓錯誤答案更難被察覺。事情重要時,主動要來源。那什麼樣的口頭答案要先查證?任何牽涉數字、日期或人名的答案。
Gemini 3.8 Live 放在其他語音助理旁邊看
Android 上多數語音助理,不是把文字模型硬接上一層語音,就是只會處理狹窄指令的解析器。你講一句話就能聽出差別。文字模型那一派在輪流發話與口音一致性上會卡;指令解析器則在你問開放式問題的當下就崩掉。
Gemini Live 語音代理站在這兩極中間,而且想跨過去。它處理開放式對話、維持穩定嗓音、還能在句子跑到一半時真的去呼叫工具。基準分數顯示這是一次真實的躍進。不過分數和實際體驗不一定同步,我會把排行榜數字當訊號,不當保證。
真要比較,最接近的對手是其他前沿的語音轉語音系統。這裡的差異點有兩個:背景推理不會打斷對話,以及鋪開方式是把模型塞進 Search 與 Gmail,而不是做一個獨立 App。
Gemini 3.8 Live 的結論
Gemini 3.8 Live 是 Google 押的注:跟 AI 講話應該像跟人講話,而不是等一部機器。基礎版把對話維持得流暢,而且便宜到能規模化;Extended Thinking 補上真正需要推理的任務,同時不必讓對話消音。
如果你在 Android 上用 Google 應用程式,其實已經半隻腳踏進去了,Search Live 就是入口。如果你訂了 Google AI 方案,同一套語音引擎會延伸到 Gmail、Docs 與 Keep。
實際該做的,是挑一件平常你會用打字的任務,改用講的。先從小事開始,比如問一張照片裡的東西或一個冷知識,然後往多步驟的請求推,觀察它怎麼敘述自己的進度。那段來回就是這些語音模型真正值錢的地方,也是判斷這次升級配不配得上宣傳的最直接方式。想第一時間試到更新後的語音體驗,可以先到 APKPure 下載最新版 Gemini 應用程式,之後再進入應用程式內的設定,看看哪些功能已經開通到你的帳號。安全與隱私方面也別忘了留意,每次授權麥克風與鏡頭權限前,先確認自己知道這些資料會被送到哪裡。