與 AI 的「對話」藝術:Gemini 3.8 Live 如何改變我們的生活景觀

描繪人類透過智慧型手機與 AI 語音助理自然對話的插畫
AI Summary

Google 最新的語音模型 Gemini 3.8 Live 與 Extended Thinking 大幅強化了實時語音對話能力,能協助 AI 在執行複雜任務的同時,保持對話流暢不中斷。

想像一下:早晨起床後,您對著手機說:「今天會議很多,請幫我找一下午餐時間附近最近的餐廳並順便預訂。」若是以前的 AI 助理,在搜尋與訂位期間可能會停頓說「請稍候」,或是直接中斷對話。但在即將到來的世界裡,AI 將如同您身旁能幹的秘書,平順地回應:「正在為您搜尋餐廳,有幾間不錯的選擇,要預訂 12 點 30 分那間嗎?」對話過程毫無中斷。

Google 最近發布的「Gemini 3.8 Live」與「Gemini 3.8 Live Extended Thinking」,正是讓此類未來願景成為現實的最先進語音對話模型出處 1 出處 4

為何這項技術如此重要?

過去我們使用的許多語音 AI,在提問後進行數據搜尋與生成回答的過程中,會給人一種對話暫停的感覺。這就像廚師在做菜時廚房完全靜音,直到料理完成才又發出聲響一樣。

然而,本次推出的模型是專為「即時語音代理(Real-time Voice Agents)」所設計出處 3。當 AI 與使用者對話時,AI 能夠自行執行複雜任務,並將處理內容回饋給使用者,從而保持對話的脈絡出處 1。這意味著人類與 AI 之間將能實現更自然、更深入的協作。

深入淺出解析

為了理解這項技術,我們用兩個比喻來說明:

第一,「邊思考邊對話」:『Gemini 3.8 Live Extended Thinking』模型就像我們在思考時會自言自語一樣。當 AI 處理複雜請求時,它會透過語音告知進度,例如:「我正在瀏覽數據」或是「處理這項資訊需要一點時間」出處 8。如此一來,使用者便能確知 AI 並非放棄回應,而是正在努力運作中。

第二,「擁有眼耳的魔法師」:這些模型不僅僅是傾聽聲音。它們是能夠同時理解語音、圖像、影片與文字的「多模態(Multimodal)」AI出處 2。就如同同時具備視覺與聽覺的人,能綜合判斷情境並參與對話。這歸功於其能一次記憶並分析高達 128K(約 12 萬 8 千個) Token 的龐大資訊量出處 2

目前現況

目前 Google 的這些模型已展現了驚人的成果。根據機構「Artificial Analysis」的評估,『Gemini 3.8 Live Extended Thinking』模型在「語音對話品質指數(Speech-to-Speech Quality Index)」中綜合排名第一出處 10。它以 82.6 的高分證明了其業界頂尖的效能出處 7 出處 12

此外,由於支援全球 97 種以上的語言,包含韓語在內的各國使用者都能更便利地與 AI 助理溝通出處 11 出處 15。您可以立即透過 Gemini 應用程式或 Google AI Studio 親自體驗這項技術出處 8

未來展望

近幾個月來,Google 展現了快速的研發步伐,幾乎每 3 週就會更新一次主要的 Gemini 模型出處 5。這顯示了 AI 融入我們日常生活裝置的速度正日益加快。

未來,AI 助理將不再只是單純的指令執行器,而是能與我們共同思考、提供建議的真正「夥伴」。此次更新是 AI 對話從純粹的技術通訊,邁向更接近人類互動的一個重要里程碑。

MindTickleBytes AI 記者觀點

人類的對話不僅是資訊交換,更是一個分享「思維流」的過程。此次的新模型讓 AI 更進一步,在不干擾人類思維節奏的前提下,成為能夠共同思考的夥伴。

參考資料

  1. Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking - The Keyword
  2. Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
  3. Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production-Grade Voice Agents
  4. Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail
  5. Gemini 3.8 Live & Extended Thinking: Google Voice AI [2026]
  6. Gemini 3.8 Live Launch: 82.6 Voice AI Score [2026]
  7. Meet Gemini 3.8 Live and 3.8 Live Extended Thinking: our best…
  8. 「Gemini 3.8 Live/3.8 Live Extended Thinking」正式発表 – Jetstream
  9. [Gemini 3.8 Live и 3.8 Live Extended Thinking… AiManual](https://ai-manual.ru/article/gemini-38-live-i-38-live-extended-thinking-golosovyie-ai-agentyi-s-parallelnyim-myishleniem/)
  10. Google DeepMind выпустила Gemini 3.8 Live и Extended Thinking…
  11. Gemini 3.8 Live: Google Splits Its Voice Line in Two
  12. Gemini 3.8 Live Extended Thinking Pricing, Specs & Sources
  13. Google launches Gemini 3.8 Live to take on OpenAI’s GPT-Live-1 at…
AD
測試你的理解
Q1. 此次發布的「Extended Thinking」模型最大特點是什麼?
  • 僅能識別圖像
  • 能一邊說明工作進度,一邊維持對話流暢
  • 僅能透過文字對話
Extended Thinking 模型強化了 AI 的功能,讓 AI 在處理複雜任務時,能透過語音說明其想法或工作進度,確保對話不中斷。
Q2. Gemini 3.8 Live 模型可以處理哪些類型的輸入數據?
  • 僅限語音數據
  • 僅限文字
  • 語音、圖像、影片與文字
新模型支援多模態輸入,包含語音、圖像、影片以及文字。
Q3. 該模型在 Artificial Analysis 的 Speech-to-Speech 排行榜中獲得了幾分?
  • 70.5 分
  • 82.6 分
  • 90.0 分
Gemini 3.8 Live Extended Thinking 模型在 Artificial Analysis 的語音對話品質指數中,以 82.6 分榮獲綜合第一名。