구글 딥마인드가 텍스트, 코드, 이미지, 영상, 오디오를 하나의 공간에서 처리하는 가볍고 개방적인 다중 모달 임베딩 모델 'EmbeddingGemma 2'를 공개했습니다.
상상해보세요. 오늘 아침, 여러분의 스마트폰에는 수천 장의 사진과 수십 개의 영상, 그리고 틈틈이 녹음해둔 회의 오디오 메모가 쌓였습니다. 평소라면 이 데이터들을 일일이 찾아보거나, AI 서비스에 데이터를 클라우드로 전송해 분석을 맡겨야 했겠죠. 하지만 이제 단 한 번의 ‘검색어’ 입력만으로 내 폰 안에서 모든 정보가 연결되는 세상이 다가오고 있습니다. 구글 딥마인드(Google DeepMind)가 2026년 10월 6일 공개한 새로운 모델, ‘EmbeddingGemma 2’가 바로 그 가능성을 열고 있습니다[Source 3, Source 5, Source 10].
이게 왜 중요한가요?
기존 AI 모델들은 대부분 텍스트면 텍스트, 이미지면 이미지처럼 특정 데이터 형식에 특화되어 있었습니다. 하지만 우리가 살아가는 현실은 훨씬 복합적이죠. 비디오 속 상황을 이해하거나, 음성 녹음 내용과 관련된 문서를 찾는 일은 매우 흔한 일입니다.
무엇보다 중요한 변화는 ‘프라이버시’입니다. EmbeddingGemma 2는 개인의 소중한 정보를 외부 클라우드 서버로 보내지 않고, 내 스마트폰이나 노트북 같은 개인 기기(온디바이스, On-device)에서 곧바로 해결할 수 있도록 설계되었습니다[Source 4]. 사생활 보호는 물론, 인터넷 연결 없이도 빠르고 지연 시간 없는(ultra-low-latency) AI 경험을 누릴 수 있게 된 것이죠[Source 4].
쉽게 이해하기: 데이터를 ‘좌표’로 바꾸는 마법
EmbeddingGemma 2를 이해하려면 먼저 ‘임베딩(Embedding)’이라는 개념을 알아야 합니다.
쉽게 비유하자면, 마치 세상의 모든 책들을 도서관에 분류해 넣는 것과 같습니다. ‘임베딩’은 텍스트, 코드, 이미지, 비디오, 오디오라는 서로 다른 형태의 데이터들을 도서관의 책처럼 ‘수치화된 좌표(768차원 벡터 공간)’라는 하나의 공간에 나란히 놓는 기술입니다[Source 5, Source 10, Source 11].
- 쉽게 말해서, AI는 이 모델을 통해 ‘개 짖는 소리(오디오)’와 ‘개가 뛰어노는 영상(비디오)’, 그리고 ‘강아지 사진(이미지)’이 사실은 같은 의미(강아지)를 담고 있다는 것을 단번에 파악합니다[Source 9, Source 11].
- 우리가 외국어를 배울 때 ‘Apple’이라는 단어와 ‘빨간 사과 이미지’를 연결해 기억하듯이, 이 모델은 텍스트부터 비디오까지 서로 다른 모달리티(Modality, 데이터 유형)를 하나로 묶어 이해합니다[Source 5, Source 11].
EmbeddingGemma 2는 7억 4천만 개의 파라미터(Parameter, AI가 학습한 조절 가능한 숫자값)를 가진 모델입니다[Source 4, Source 7, Source 10]. 이는 스마트폰 같은 개인용 기기에서 돌아갈 만큼 가볍고 효율적이라는 뜻입니다. 한국 전체 인구의 약 14배에 달하는 파라미터 수를 작은 칩셋 안에 담아내어, 폰 안에서 즉각적으로 복잡한 검색과 의사결정을 수행할 수 있게 된 것입니다[Source 4, Source 10].
현재 상황
현재 EmbeddingGemma 2는 구글 딥마인드에 의해 오픈 모델로 공개되었습니다[Source 9, Source 10]. 개발자들은 허깅페이스(Hugging Face)와 캐글(Kaggle) 등에서 이 모델의 가중치(Weight, 모델이 학습한 데이터)를 확인하고 직접 활용할 수 있습니다[Source 3]. 아파치 2.0 라이선스(Apache 2.0 license)를 적용해 누구나 자유롭게 연구하고 제품에 활용할 수 있도록 문을 열어두었습니다[Source 10].
이미 미디어파이프(MediaPipe)나 라이트RT(LiteRT) 같은 구글의 온디바이스 개발 도구와 결합하여, 기기 내부의 검색이나 판단을 돕는 ‘AI의 눈과 귀’ 역할을 할 준비를 마친 상태입니다[Source 4].
앞으로 어떻게 될까?
앞으로는 스마트폰에서 단순히 “어제 회의에서 김 대리가 한 말 찾아줘”라고 묻는 것을 넘어, “어제 회의 중 노트북 화면을 공유했던 영상 부분 찾아줘”와 같은 다차원적인 질문이 가능해질 것입니다[Source 7]. 또한, 별도의 클라우드 비용 없이도 개인화된 AI 비서가 내 모든 기록을 통합적으로 관리하고 찾아주는 ‘개인 정보 중심의 AI 시대’가 가속화될 전망입니다[Source 4].
MindTickleBytes의 AI 기자 시선
‘EmbeddingGemma 2’는 AI가 단순히 똑똑해지는 것을 넘어, 우리 일상에 얼마나 깊숙이, 그리고 안전하게 파고들 수 있는지를 보여주는 기술입니다. 거대 모델들이 클라우드에서 천문학적인 비용으로 돌아갈 때, 이렇게 가볍고 개방적인 모델들이 우리 손안의 기기에서 스스로 생각하고 검색하는 능력은 진정한 의미의 ‘개인용 AI 시대’를 여는 열쇠가 될 것입니다.
참고자료
- EmbeddingGemma 2 is a best-in-class open model for natively…
- Google launches EmbeddingGemma 2 for on-device AI
- Bring multimodal semantic search to the edge with…
-
[EmbeddingGemma 2: Benchmarks, Specs and How to Run It CellCog](https://cellcog.ai/blog/embeddinggemma-2/) -
[Google launches the next version of its on-device AI model. The Verge](https://www.theverge.com/tech/1005886/google-launches-the-next-version-of-its-on-device-ai-model) - Представляем EmbeddingGemma 2: открытая модель… - YouTube
- EmbeddingGemma 2 announced as Google DeepMind’s first natively…
- DeepMind Debuts EmbeddingGemma 2, Mapping Five Modalities Into…
- EmbeddingGemma 2 is a multimodal embedding model from…
- 비디오
- 오디오
- 뇌파
- 클라우드 전용 모델
- 7억 4천만 개의 파라미터를 가진 온디바이스 모델
- 비공개 상용 라이선스
- 데이터를 압축해서 버린다
- 데이터를 고차원 공간의 수치(벡터)로 변환해 의미를 파악한다
- 이미지를 텍스트로만 변환한다