구글이 발표한 실시간 음성 대화형 AI인 '제미나이 3.8 라이브'와 '확장된 사고' 모델은 AI와의 대화를 더 매끄럽고 지능적인 실제 대화처럼 느껴지도록 설계되었습니다.
상상해보세요. 바쁜 아침에 일어나서 스마트폰 AI 비서에게 “오늘 오후 회의 자료 좀 정리해서 대화하듯 요약해줄래?”라고 물었을 때, 마치 아주 똑똑한 비서가 바로 옆에서 대답하듯 자연스럽게 대화가 이어지는 모습을요. 기존의 딱딱한 명령어 입력 방식이 아닌, 사람이랑 대화하는 것 같은 매끄러운 경험, 구글이 바로 이 지점을 향해 큰 발걸음을 내디뎠습니다.
구글은 지난 2026년 9월 15일, 새로운 음성 중심의 AI 모델인 ‘제미나이 3.8 라이브(Gemini 3.8 Live)’와 ‘제미나이 3.8 라이브 확장된 사고(Gemini 3.8 Live Extended Thinking)’를 공식 발표했습니다 [출처: Google Launches Gemini 3.8 Live and Extended Thinking Models]. 이제 AI는 단순히 명령을 수행하는 기계가 아니라, 우리의 일상적인 대화 파트너로 진화하고 있습니다.
이게 왜 중요한가요?
그동안 우리가 경험한 음성 AI는 마치 자동응답 시스템(ARS) 메뉴를 음성으로 읽어주는 듯한 느낌이 강했습니다. 대화 중간에 말을 끊거나, 복잡한 질문을 하면 버벅거리기 일쑤였죠. 하지만 이번에 발표된 모델들은 사용자와의 대화 흐름을 방해하지 않고, 마치 진짜 사람과 소통하는 것 같은 매끄러운 경험을 제공하는 것을 목표로 합니다 [출처: Google Releases Gemini 3.8 Live-Extended Conversational Model].
개발자나 기업 입장에서 이는 사용자에게 훨씬 더 친숙하고 효율적인 음성 서비스, 예를 들면 스마트한 고객 상담 봇이나 개인 비서 서비스를 더 쉽게 구현할 수 있게 된다는 뜻입니다 [출처: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models].
쉽게 이해하기
이 새로운 기술을 이해하기 위해 두 가지 비유를 들어볼게요.
쉽게 말해서, 첫째는 ‘연속적인 필름’ 비유입니다. 기존의 AI 모델들이 사진 한 장 한 장을 따로 처리하는 방식이었다면, 제미나이 3.8 라이브 모델들은 오디오, 비디오, 텍스트 데이터를 마치 긴 영화 필름처럼 끊김 없이 실시간으로 처리합니다 [출처: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card]. 그래서 우리가 말하는 도중에도 상황을 바로 이해하고 자연스럽게 반응할 수 있는 것이죠. 마치 영화 속에서 배우들이 끊김 없이 대화를 주고받는 것과 같습니다.
둘째는 ‘생각의 깊이’ 비유입니다. 모델을 두 가지로 나눈 이유가 여기에 있습니다. ‘제미나이 3.8 라이브’는 일상적이고 효율적인 대화에 최적화된 ‘빠르고 민첩한 선수’라면, ‘제미나이 3.8 라이브 확장된 사고’는 아주 복잡한 문제나 깊은 논리적 사고가 필요한 대화를 맡는 ‘신중한 분석가’라고 생각하시면 쉽습니다 [출처: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking]. 어려운 수학 문제나 복잡한 계획을 세울 때, 잠시 멈추고 깊이 생각한 뒤 답을 주는 전문가와 비슷하죠.
어디에서 사용할 수 있나요?
현재 이 기술들은 제미나이 API(Application Programming Interface, 프로그램 간의 연결 통로), 구글 AI 스튜디오, 그리고 제미나이 엔터프라이즈를 통해 개발자와 기업들이 직접 활용할 수 있도록 공개된 상태입니다 [출처: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models]. 조만간 우리가 평소 사용하는 앱 서비스들에서 더 똑똑해진 음성 AI를 만날 가능성이 매우 커졌다는 의미입니다.
앞으로 어떻게 될까?
앞으로는 AI와 대화할 때 단순히 ‘명령’을 내린다는 느낌보다는, 필요한 정보를 묻고 답하는 ‘협업’의 느낌이 더 강해질 것입니다. 특히 비디오와 오디오를 결합한 정보를 실시간으로 인식할 수 있기 때문에, 예를 들어 스마트폰 카메라를 통해 보여주는 상황을 AI가 실시간으로 설명해주거나 같이 고민해주는 등의 더 발전된 에이전트 서비스들이 등장할 것으로 보입니다 [출처: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card].
우리가 AI를 그저 명령어를 입력하는 도구로 다루던 단계를 넘어, AI와 함께 일상을 나누는 파트너십의 시대가 조금 더 가까워진 것 같습니다.
AI의 Take
구글 딥마인드(Google DeepMind)는 이 모델들에 대해 “사용자의 대화 흐름을 깨뜨리지 않고 배경에서 대화하고, 생각하고, 작업을 처리하는 최고의 대화형 AI”라고 설명합니다 [출처: Google DeepMind on X].
이번 제미나이 3.8 라이브 모델의 핵심은 ‘기술의 속도’를 넘어 ‘대화의 맥락’을 확보했다는 점입니다. AI가 얼마나 빨리 대답하느냐보다, 우리와 얼마나 더 자연스럽게 어울릴 수 있느냐가 진정한 혁신의 척도가 되고 있습니다.
참고자료
- Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking
- Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
- Gemini 3.8 Live: gemini-3.8-live, 97 языков и Extended Thinking
- Google Launches Gemini 3.8 Live and Extended Thinking Models
- Google Releases Gemini 3.8 Live-Extended Conversational Model
- Google DeepMind on X
- Google Launches Gemini 3.8 Live and Extended Thinking Voice Models
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- 이미지 생성 속도 향상
- 더 자연스럽고 지능적인 실시간 음성 대화 구현
- 텍스트 번역 전용 엔진 구축
- 텍스트 데이터만 처리
- 오디오 데이터만 처리
- 연속적인 오디오, 비디오, 텍스트 스트림을 실시간 처리
- 제미나이 API, 구글 AI 스튜디오 등에서 제공
- 전용 하드웨어 기기에서만 작동
- 오직 오프라인 환경에서만 구동