Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

Gemini 3.8 Live 是什麼?Google 全新語音模型完整解析 2026

Molly Reagan
Molly Reagan內容編輯

2026年09月17日

Google 於 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,主打邊說邊推理、即時視覺與背景工具執行。這篇說清楚 Gemini 語音模型到底改變了什麼。

目錄

    Google 在 9 月 15 日一次丟出兩個語音模型,直接進了數百萬支 Android 手機的首頁畫面。這兩個模型分別是 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,來自 Google DeepMind 的 Gemini Audio 團隊,訴求只有一句:跟你講話的方式,要像跟人講話。

    如果你曾經對著手機問問題,然後卡在那段「它正在思考」的空白裡,這次更新就是衝著你來的。對話不再被切斷,機器在背景把事做完,你繼續聊你的。

    Google Gemini APK

    與 Google AI 對話,幫助你撰寫內容、擬定計畫及學習新知等

    生產應用

    生產應用

    Gemini 3.8 Live 到底是什麼

    先講清楚定位。Gemini 3.8 Live 是為規模與成本而生的那一顆,把對話智慧、流暢對答與視覺理解綁在一起。說白話,它能跟你來回聊,也能一邊聊一邊看你鏡頭拍到的東西。

    另一顆 Gemini 3.8 Live Extended Thinking 是重量級。它在講話的同時跑多步推理,遇到複雜請求不會突然安靜,而是邊處理邊回你。

    兩顆都屬於 Gemini Audio 系列,架構上奠基於 Gemini 3 Pro。輸入接收音訊、圖像、影片與文字,詞元上下文視窗最高 128K,輸出視窗 64K。這個上下文比表面看起來重要。一段聊食譜、聊文件、聊修理流程的長對話會留在記憶裡,不會講到一半掉出視窗。

    這裡沒有開放權重的下載檔。它們是託管模型,你得透過 Google 的伺服器使用,不是塞在手機裡跑。這件事也決定了隱私輪廓:你的語音是送到 Google 處理的,不是交給存在本機的模型。選方案前先想清楚這一點。

    3CyW24Pkz4o image

    Gemini 語音模型是怎麼把對話接起來的

    舊架構像接力賽。第一個系統負責聽,把你說的話轉成文字。第二個語言模型讀逐字稿,寫出回覆。第三個系統再把回覆唸出來。三套系統串在一起,每一次交接都加一段延遲,而且前面一個小小的轉錄錯誤,會在答案從喇叭出來之前滾成完全走鐘的結果。

    Gemini 3.8 Live 把接力棒丟了。它直接聽音訊、直接產生音訊,一次動作完成,所以對話聽起來接近打電話,而不是對講機。

    實際好處落在三件事上。第一,它幾乎即時處理你鏡頭對準的東西,所以能針對眼前那個物件講話。第二,它會在對話中途自動偵測並切換 97 種支援語言,回話時還會維持你的口音。第三,它在背景執行工具與 API 呼叫,所以可以說一句「等我一下」,然後繼續跟你聊,直到任務收尾。

    最後這項行為是真正的轉折點。模型收到請求、維持對話不斷、任務結束再收線。沒有冷場。

    Gemini 3.8 Live Extended Thinking 差在哪裡

    Extended Thinking 的差別是「同時推理、同時說話」。聽起來只是小調整,其實不是。舊的推理模型只有兩條路:答得快但淺,或是沉默很久去想。

    它改用早期的口頭提示來守住發話權。會先說一句「我查一下」,然後在跑多步任務的過程中一步步敘述進度。對於要花超過幾秒的工作,這段碎念就是你選擇信任系統、還是放棄對話的分界線。

    Google 自己的示範裡,它把一張手繪加上口頭回饋變成可運作的 React 元件,也協調了一次多步驟預約。這些偏開發者場景,但對一般使用者的暗示很清楚:你描述需求,邊講邊修,中間那段它接手。

    基準數字撐得起這個野心。Extended Thinking 在 Artificial Analysis 的語音對語音品質指數拿下整體第一,分數 82.6。代理任務完成度在 τ-Voice 拿到 68.6%,在 Sierra 的 τ-Voice-banking 拿到 35.1%,Big Bench Audio 則是 97.7%。基礎版 Gemini 3.8 Live 則在語音代理競技場(Speech Agent Arena)這種人類偏好測試裡排第二。

    今天在 Android 上哪裡用得到 Gemini 3.8 Live

    上線就在發表當天開始,覆蓋範圍比開發者預覽大得多。

    一般使用者這邊,Gemini 3.8 Live 撐起了 Google 應用程式裡的 Search Live。你開口問,回來的是一段口語對話,不是一頁連結。Extended Thinking 正在推送到 Gemini Live,對 Google AI Pro 與 Ultra 訂閱者還延伸到 Workspace 的 Docs,Google AI 訂閱者則涵蓋 Gmail 與 Keep。

    這個鋪開範圍值得停下來看一下。同一顆語音模型,一邊跑一般聊天,一邊處理 Gmail 裡的對話式搜尋和 Keep 的筆記建立。如果你付費訂了 Google AI 方案,早上打開的那些應用程式裡,語音工具會跟著變聰明。

    開發者則透過 Gemini Live API 與 Google AI Studio 使用這兩顆模型。音訊輸入每分鐘 0.005 美元,音訊輸出每分鐘 0.018 美元。

    4P3iKlmQmM0 image

    Gemini Live 語音代理在 Android 上的實際場景

    抽象能力講起來很容易。放到手上是這樣。

    設想你拿著手機,鏡頭對著家電上那串看不懂的錯誤代碼,直接開口問它什麼意思。模型讀出螢幕、解釋故障,再帶你走完一次排除流程,全程一個對話搞定。不用截圖,不用打字。

    再想像廚房裡你兩隻手都是麵團。你問能不能換掉某個材料,模型回答,你再追問,它還記得你兩分鐘前提過的那份食譜。128K 的上下文就是那條線沒斷的原因。

    或者換成在公園散步、環境有點吵。你想知道怎麼走到某個地標,順便聽一句它的來歷。語音代理一輪就回你,背景的工具呼叫去撈地圖資料,完全沒有打斷對話。

    共同點是免持、不用眼睛。這正是真正的語音轉語音模型勝過文字介面的地方,也是 Google 把這些模型推向手機、而不是鍵盤的理由。

    Gemini 3.8 Live 的優點與限制

    你會得到的:

    • 自然的節奏,能接住插話與打斷
    • 即時視覺,模型可以討論鏡頭裡的東西
    • 一段對話內自動切換 97 種語言
    • 背景工具執行,讓對話不中斷
    • 一般使用者就能在 Search Live 與 Gemini Live 用到,不只是開發者

    你該留意的:

    • 模型卡把幻覺,以及偶發的緩慢或逾時列為已知限制
    • 知識截止日是 2025 年 1 月,太新的事件可能得靠即時工具呼叫補上
    • 音訊輸出帶有 SynthID 浮水印,AI 生成的片段可被偵測
    • 這是託管模型,沒有自行架設的選項

    幻覺那一點不是附註。語音助理聽起來比文字框更有權威感,而這種自信會讓錯誤答案更難被察覺。事情重要時,主動要來源。那什麼樣的口頭答案要先查證?任何牽涉數字、日期或人名的答案。

    Gemini 3.8 Live 放在其他語音助理旁邊看

    Android 上多數語音助理,不是把文字模型硬接上一層語音,就是只會處理狹窄指令的解析器。你講一句話就能聽出差別。文字模型那一派在輪流發話與口音一致性上會卡;指令解析器則在你問開放式問題的當下就崩掉。

    Gemini Live 語音代理站在這兩極中間,而且想跨過去。它處理開放式對話、維持穩定嗓音、還能在句子跑到一半時真的去呼叫工具。基準分數顯示這是一次真實的躍進。不過分數和實際體驗不一定同步,我會把排行榜數字當訊號,不當保證。

    真要比較,最接近的對手是其他前沿的語音轉語音系統。這裡的差異點有兩個:背景推理不會打斷對話,以及鋪開方式是把模型塞進 Search 與 Gmail,而不是做一個獨立 App。

    Gemini 3.8 Live 的結論

    Gemini 3.8 Live 是 Google 押的注:跟 AI 講話應該像跟人講話,而不是等一部機器。基礎版把對話維持得流暢,而且便宜到能規模化;Extended Thinking 補上真正需要推理的任務,同時不必讓對話消音。

    如果你在 Android 上用 Google 應用程式,其實已經半隻腳踏進去了,Search Live 就是入口。如果你訂了 Google AI 方案,同一套語音引擎會延伸到 Gmail、Docs 與 Keep。

    實際該做的,是挑一件平常你會用打字的任務,改用講的。先從小事開始,比如問一張照片裡的東西或一個冷知識,然後往多步驟的請求推,觀察它怎麼敘述自己的進度。那段來回就是這些語音模型真正值錢的地方,也是判斷這次升級配不配得上宣傳的最直接方式。想第一時間試到更新後的語音體驗,可以先到 APKPure 下載最新版 Gemini 應用程式,之後再進入應用程式內的設定,看看哪些功能已經開通到你的帳號。安全與隱私方面也別忘了留意,每次授權麥克風與鏡頭權限前,先確認自己知道這些資料會被送到哪裡。

    Google Gemini APK

    與 Google AI 對話,幫助你撰寫內容、擬定計畫及學習新知等

    生產應用

    生產應用

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    最新測評
    2026 年 9 月 Android 安全更新是什麼?
    Android 開發者驗證是什麼?9 月 30 日截止期限與影響全解析
    什麼是 Fireworks Ember-1?基於 Kimi K3 的推理模型全解析 2026
    崩壞:星穹鐵道 4.6 版本盤點:Pearl、新時裝與聯動內容
    高人氣測評
    Grok Bot 對比其他 AI 代理:有何不同
    ZCode 價格 2026:GLM Coding 方案解析
    Claude 是否有意識?Anthropic 道德研究與 Claude 人工智慧倫理完整解讀
    鳴潮 3.7 前瞻:開播前已知情報全盤點
    Meta muse for Mac 是什麼?可操作電腦檔案的 AI 代理完整解析
    Claude Code Cloud sessions 盤點:功能與使用場景一次看懂
    Claude Sonnet 5.5 是什麼?基準測試與更新重點
    GPT-6 Sol 與 Luna 完整解析:OpenAI 新模型怎麼用、便宜在哪
    訂閱APKPure
    第一時間獲取熱門安卓遊戲應用的首發體驗,最新資訊和玩法教程。
    不,謝謝
    訂閱
    訂閱成功!
    您已訂閱APKPure。