Google 最新的語音模型 Gemini 3.8 Live 與 Extended Thinking 大幅強化了實時語音對話能力,能協助 AI 在執行複雜任務的同時,保持對話流暢不中斷。
想像一下:早晨起床後,您對著手機說:「今天會議很多,請幫我找一下午餐時間附近最近的餐廳並順便預訂。」若是以前的 AI 助理,在搜尋與訂位期間可能會停頓說「請稍候」,或是直接中斷對話。但在即將到來的世界裡,AI 將如同您身旁能幹的秘書,平順地回應:「正在為您搜尋餐廳,有幾間不錯的選擇,要預訂 12 點 30 分那間嗎?」對話過程毫無中斷。
Google 最近發布的「Gemini 3.8 Live」與「Gemini 3.8 Live Extended Thinking」,正是讓此類未來願景成為現實的最先進語音對話模型出處 1 出處 4。
為何這項技術如此重要?
過去我們使用的許多語音 AI,在提問後進行數據搜尋與生成回答的過程中,會給人一種對話暫停的感覺。這就像廚師在做菜時廚房完全靜音,直到料理完成才又發出聲響一樣。
然而,本次推出的模型是專為「即時語音代理(Real-time Voice Agents)」所設計出處 3。當 AI 與使用者對話時,AI 能夠自行執行複雜任務,並將處理內容回饋給使用者,從而保持對話的脈絡出處 1。這意味著人類與 AI 之間將能實現更自然、更深入的協作。
深入淺出解析
為了理解這項技術,我們用兩個比喻來說明:
第一,「邊思考邊對話」:『Gemini 3.8 Live Extended Thinking』模型就像我們在思考時會自言自語一樣。當 AI 處理複雜請求時,它會透過語音告知進度,例如:「我正在瀏覽數據」或是「處理這項資訊需要一點時間」出處 8。如此一來,使用者便能確知 AI 並非放棄回應,而是正在努力運作中。
第二,「擁有眼耳的魔法師」:這些模型不僅僅是傾聽聲音。它們是能夠同時理解語音、圖像、影片與文字的「多模態(Multimodal)」AI出處 2。就如同同時具備視覺與聽覺的人,能綜合判斷情境並參與對話。這歸功於其能一次記憶並分析高達 128K(約 12 萬 8 千個) Token 的龐大資訊量出處 2。
目前現況
目前 Google 的這些模型已展現了驚人的成果。根據機構「Artificial Analysis」的評估,『Gemini 3.8 Live Extended Thinking』模型在「語音對話品質指數(Speech-to-Speech Quality Index)」中綜合排名第一出處 10。它以 82.6 的高分證明了其業界頂尖的效能出處 7 出處 12。
此外,由於支援全球 97 種以上的語言,包含韓語在內的各國使用者都能更便利地與 AI 助理溝通出處 11 出處 15。您可以立即透過 Gemini 應用程式或 Google AI Studio 親自體驗這項技術出處 8。
未來展望
近幾個月來,Google 展現了快速的研發步伐,幾乎每 3 週就會更新一次主要的 Gemini 模型出處 5。這顯示了 AI 融入我們日常生活裝置的速度正日益加快。
未來,AI 助理將不再只是單純的指令執行器,而是能與我們共同思考、提供建議的真正「夥伴」。此次更新是 AI 對話從純粹的技術通訊,邁向更接近人類互動的一個重要里程碑。
MindTickleBytes AI 記者觀點
人類的對話不僅是資訊交換,更是一個分享「思維流」的過程。此次的新模型讓 AI 更進一步,在不干擾人類思維節奏的前提下,成為能夠共同思考的夥伴。
參考資料
- Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking - The Keyword
- Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production-Grade Voice Agents
- Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail
- Gemini 3.8 Live & Extended Thinking: Google Voice AI [2026]
- Gemini 3.8 Live Launch: 82.6 Voice AI Score [2026]
- Meet Gemini 3.8 Live and 3.8 Live Extended Thinking: our best…
- 「Gemini 3.8 Live/3.8 Live Extended Thinking」正式発表 – Jetstream
-
[Gemini 3.8 Live и 3.8 Live Extended Thinking… AiManual](https://ai-manual.ru/article/gemini-38-live-i-38-live-extended-thinking-golosovyie-ai-agentyi-s-parallelnyim-myishleniem/) - Google DeepMind выпустила Gemini 3.8 Live и Extended Thinking…
- Gemini 3.8 Live: Google Splits Its Voice Line in Two
- Gemini 3.8 Live Extended Thinking Pricing, Specs & Sources
- Google launches Gemini 3.8 Live to take on OpenAI’s GPT-Live-1 at…
- 僅能識別圖像
- 能一邊說明工作進度,一邊維持對話流暢
- 僅能透過文字對話
- 僅限語音數據
- 僅限文字
- 語音、圖像、影片與文字
- 70.5 分
- 82.6 分
- 90.0 分