구글의 최신 음성 모델 Gemini 3.8 Live와 Extended Thinking은 실시간 음성 대화 능력을 대폭 강화하여, AI가 복잡한 작업을 수행하면서도 대화의 흐름을 끊기지 않게 도와줍니다.
상상해보세요. 아침에 일어나서 스마트폰을 향해 “오늘 회의가 많은데, 점심시간에 맞춰 제일 가까운 식당을 찾고 예약까지 해줘”라고 말합니다. 이전의 AI 비서라면 식당을 찾고 예약하는 동안 “잠시만요”라며 멈춰 있거나, 대화가 뚝 끊기기 일쑤였죠. 하지만 이제는 AI가 마치 옆에 있는 유능한 비서처럼 “식당들을 찾고 있어요. 괜찮은 곳이 몇 군데 있는데, 12시 30분에 예약 가능한 곳으로 할까요?”라며 끊김 없이 대화를 이어가는 세상이 오고 있습니다.
구글이 최근 발표한 ‘Gemini 3.8 Live’와 ‘Gemini 3.8 Live Extended Thinking’은 바로 이런 미래를 현실로 만드는 가장 앞선 음성 대화 모델입니다출처 1 출처 4.
이게 왜 중요한가요?
지금까지 우리가 사용하던 많은 음성 AI는 질문을 하면 데이터를 검색하고 답변을 생성하는 동안 대화가 일시 정지되는 듯한 느낌을 주었습니다. 이는 마치 요리사가 음식을 만드는 동안 주방에서 소리가 전혀 들리지 않다가 요리가 완성되어야만 다시 나오는 것과 같았죠.
하지만 이번에 출시된 모델들은 ‘실시간 음성 에이전트’를 위해 설계되었습니다출처 3. 사용자와 AI가 대화하는 도중에도 AI가 스스로 복잡한 작업을 수행하고, 그 내용을 사용자에게 다시 알려줌으로써 대화의 맥락이 깨지지 않게 도와줍니다출처 1. 이는 AI와 훨씬 더 자연스럽고 깊이 있는 협업이 가능해짐을 의미합니다.
쉽게 이해하기
이 기술을 이해하기 위해 두 가지 비유를 들어볼게요.
첫 번째, ‘생각하는 동안 이야기하기’: ‘Gemini 3.8 Live Extended Thinking’ 모델은 우리가 고민할 때 혼잣말을 하는 것과 비슷합니다. AI가 복잡한 요청을 처리할 때, “지금 데이터를 살펴보고 있습니다” 혹은 “이 정보를 처리하는 데 시간이 조금 걸리네요”라고 진행 상황을 음성으로 들려줍니다출처 8. 이렇게 하면 사용자는 AI가 응답을 포기한 게 아니라 지금 열심히 일하고 있다는 것을 알 수 있죠.
두 번째, ‘눈과 귀를 가진 마법사’: 이 모델들은 단순히 목소리만 듣는 것이 아닙니다. 음성, 이미지, 비디오, 그리고 텍스트까지 한꺼번에 이해할 수 있는 ‘멀티모달(Multimodal, 다양한 형태의 데이터를 동시에 이해하는 기술)’ AI입니다출처 2. 마치 눈과 귀를 모두 가진 사람이 상황을 종합적으로 판단하여 대화에 참여하는 것과 같습니다. 이는 최대 128K(약 12만 8천 개) 토큰이라는 방대한 양의 정보를 한 번에 기억하고 분석할 수 있기 때문에 가능합니다출처 2.
현재 상황
현재 구글의 이 모델들은 이미 놀라운 성과를 보여주고 있습니다. ‘Artificial Analysis’라는 기관의 평가에 따르면, ‘Gemini 3.8 Live Extended Thinking’ 모델은 ‘음성 대화 품질 지수(Speech-to-Speech Quality Index)’에서 종합 1위를 차지했습니다출처 10. 82.6점이라는 높은 점수를 기록하며, 업계 최고 수준의 성능을 입증한 것이죠출처 7 출처 12.
또한 전 세계적으로 97개 이상의 언어를 지원하기 때문에, 한국어는 물론 다양한 언어 사용자들이 AI 비서와 더욱 편리하게 소통할 수 있게 되었습니다출처 11 출처 15. 여러분은 지금 바로 Gemini 앱이나 Google AI Studio를 통해 이 기술을 직접 체험해볼 수 있습니다출처 8.
앞으로 어떻게 될까?
구글은 최근 몇 달간 거의 3주마다 주요 Gemini 모델을 업데이트하는 빠른 행보를 보이고 있습니다출처 5. 이는 AI가 우리가 사용하는 일상적인 기기에 얼마나 빠르게 녹아들고 있는지를 보여줍니다.
앞으로 AI 비서는 단순한 명령 전달기를 넘어, 우리가 업무를 하거나 고민을 나눌 때 함께 생각하고 조언을 해주는 진정한 ‘파트너’로 발전할 것입니다. 이번 업데이트는 AI와의 대화가 기술적인 소통을 넘어, 인간적인 상호작용에 더 가까워지는 중요한 이정표가 될 것입니다.
MindTickleBytes의 AI 기자 시선
인간의 대화는 단순히 정보를 주고받는 것이 아니라 ‘생각의 흐름’을 공유하는 과정입니다. 이번 모델은 AI가 인간의 이 흐름을 방해하지 않고 함께 고민할 수 있는 수준에 한 걸음 더 다가섰습니다.
참고자료
- Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking - The Keyword
- Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production-Grade Voice Agents
- Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail
- Gemini 3.8 Live & Extended Thinking: Google Voice AI [2026]
- Gemini 3.8 Live Launch: 82.6 Voice AI Score [2026]
- Meet Gemini 3.8 Live and 3.8 Live Extended Thinking: our best…
- 「Gemini 3.8 Live/3.8 Live Extended Thinking」正式発表 – Jetstream
-
[Gemini 3.8 Live и 3.8 Live Extended Thinking… AiManual](https://ai-manual.ru/article/gemini-38-live-i-38-live-extended-thinking-golosovyie-ai-agentyi-s-parallelnyim-myishleniem/) - Google DeepMind выпустила Gemini 3.8 Live и Extended Thinking…
- Gemini 3.8 Live: Google Splits Its Voice Line in Two
- Gemini 3.8 Live Extended Thinking Pricing, Specs & Sources
- Google launches Gemini 3.8 Live to take on OpenAI’s GPT-Live-1 at…
- 이미지만 인식할 수 있다
- 작업 진행 상황을 스스로 설명하며 대화의 흐름을 유지한다
- 오직 텍스트로만 대화가 가능하다
- 오직 음성 데이터만
- 텍스트만
- 음성, 이미지, 비디오, 텍스트
- 70.5점
- 82.6점
- 90.0점