Google 發表的即時語音對話 AI『Gemini 3.8 Live』與『擴展思維』模型,旨在讓與 AI 的對話感覺更流暢、更具智慧,宛如真實對話。
試著想像一下。當您在忙碌的早晨醒來,問智慧型手機裡的 AI 助理:「能幫我整理一下今天下午會議的資料,並以對話方式為我總結嗎?」接著,對話像是一位聰明的秘書在身旁回答一樣自然地延續下去。這不是僵硬的指令輸入方式,而是像與人交談般的流暢體驗,Google 正朝著這一點邁出了巨大的一步。
Google 於 2026 年 9 月 15 日正式發表了全新的語音導向 AI 模型——「Gemini 3.8 Live」與「Gemini 3.8 Live 擴展思維 (Gemini 3.8 Live Extended Thinking)」 [出處: Google Launches Gemini 3.8 Live and Extended Thinking Models]。現在,AI 不再僅僅是執行指令的機器,正演變為我們日常生活中的對話夥伴。
這為什麼很重要?
過去我們所經歷的語音 AI,感覺就像是用聲音朗讀自動回應系統 (ARS) 的菜單一樣。在對話中途打斷它,或者提出複雜的問題,往往會導致 AI 結結巴巴。然而,這次發表的模型旨在不干擾與使用者的對話流程下,提供宛如與真人溝通般流暢的體驗 [出處: Google Releases Gemini 3.8 Live-Extended Conversational Model]。
對於開發者或企業而言,這意味著能更輕鬆地實現對使用者更友善、更高效的語音服務,例如智慧客戶諮詢機器人或個人助理服務 [出處: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models]。
輕鬆理解
為了理解這項新技術,我們舉兩個比喻。
首先是「連續膠卷」比喻。如果說過去的 AI 模型是以處理一張張獨立照片的方式運作,那麼 Gemini 3.8 Live 模型就像是把音訊、視訊和文字數據當作長電影膠卷,進行不間斷的即時處理 [出處: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card]。因此,即便在我們說話的同時,AI 也能即時理解情況並自然地反應。就像電影中演員們流暢地對話一樣。
其次是「思考深度」比喻。這就是模型分為兩種的原因。「Gemini 3.8 Live」如果是專注於日常、高效對話的「敏捷選手」,那麼「Gemini 3.8 Live 擴展思維」就可以被視為負責處理極度複雜問題或需要深度邏輯思考的「謹慎分析師」 [出處: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking]。這與處理艱深數學題或複雜計畫時,稍作停頓、深思熟慮後再回答的專家相似。
在哪裡可以使用?
目前,這些技術已透過 Gemini API(程式間的連接通道)、Google AI Studio 以及 Gemini Enterprise 公開,供開發者與企業直接應用 [出處: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models]。這意味著在不久的將來,我們在日常使用的 App 服務中見到升級版智慧語音 AI 的可能性大大提升。
未來會如何發展?
未來與 AI 對話時,比起「發號施令」,詢問所需資訊並進行「協作」的感覺將會更強烈。特別是由於能夠即時識別視訊與音訊結合的資訊,預計將會出現更先進的代理服務,例如透過智慧型手機鏡頭向 AI 展示情況,AI 即時進行說明或共同討論解決方案 [出處: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card]。
我們似乎正超越將 AI 僅視為輸入指令工具的階段,離與 AI 分享日常的夥伴關係時代更近了一步。
AI 的觀點
Google DeepMind 對這些模型描述為:「在對話流程不中斷的情況下,在背景中進行對話、思考並處理任務的頂尖對話型 AI」 [出處: Google DeepMind on X]。
本次 Gemini 3.8 Live 模型的核心在於超越了「技術速度」,轉而掌握了「對話語境」。比起 AI 回答得有多快,能與我們多自然地融合,正在成為衡量真正創新的標準。
參考資料
- Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking
- Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
- Gemini 3.8 Live: gemini-3.8-live, 97 языков и Extended Thinking
- Google Launches Gemini 3.8 Live and Extended Thinking Models
- Google Releases Gemini 3.8 Live-Extended Conversational Model
- Google DeepMind on X
- Google Launches Gemini 3.8 Live and Extended Thinking Voice Models
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- 提升圖像生成速度
- 實現更自然、更具智慧的即時語音對話
- 建立文字翻譯專用引擎
- 僅處理文字數據
- 僅處理音訊數據
- 即時處理連續的音訊、視訊及文字流
- 透過 Gemini API、Google AI Studio 等提供
- 僅在專用硬體設備上運行
- 僅能在離線環境下運作