谷歌 DeepMind 发布了轻量级、开放式的多模态嵌入模型 'EmbeddingGemma 2',该模型可在同一空间内处理文本、代码、图像、视频和音频。
想象一下:今天早上,您的智能手机里堆满了数千张照片、几十个视频,还有零零散散录制的会议音频备忘录。按照以往,您需要逐一翻找这些数据,或者将数据上传到云端交给 AI 服务分析。但现在,距离只需输入一个“搜索词”,就能让手机内的所有信息互联互通的世界已经不远了。谷歌 DeepMind (Google DeepMind) 于 2026 年 10 月 6 日发布的全新模型 ‘EmbeddingGemma 2’,正是开启这一可能性的钥匙[Source 3, Source 5, Source 10]。
为什么这很重要?
以往的 AI 模型大多专精于特定数据格式,比如文本模型处理文本,图像模型处理图像。但我们生活的现实世界要复杂得多。理解视频中的场景,或者查找与录音内容相关的文档,这些都是非常常见的需求。
最关键的变化在于“隐私”。EmbeddingGemma 2 的设计初衷就是让个人能够直接在智能手机或笔记本电脑等终端设备(端侧,On-device)上完成任务,而无需将宝贵的个人信息发送到外部云服务器[Source 4]。这意味着在保护隐私的同时,还能获得无需联网、响应极快(超低延迟,ultra-low-latency)的 AI 体验[Source 4]。
浅显易懂:将数据转换为“坐标”的魔法
要理解 EmbeddingGemma 2,首先需要了解“嵌入 (Embedding)”的概念。
打个比方,这就像把世上所有的书分门别类放入图书馆一样。“嵌入”是一项将文本、代码、图像、视频、音频等不同形态的数据,统一放置在如图书馆书架般“量化的坐标(768维向量空间)”中的技术[Source 5, Source 10, Source 11]。
- 简单来说,AI 通过这个模型可以瞬间识别出“狗叫声(音频)”、“小狗奔跑的视频(视频)”以及“小狗照片(图像)”其实表达的是同一个含义(小狗)[Source 9, Source 11]。
- 就像我们学习外语时会将单词 ‘Apple’ 与“红苹果图片”建立连接并记忆一样,该模型将文本、视频等不同模态(Modality,数据类型)整合在一起进行理解[Source 5, Source 11]。
EmbeddingGemma 2 是一个拥有 7.4 亿个参数(Parameter,AI 学习到的可调节数值)的模型[Source 4, Source 7, Source 10]。这意味着它足够轻量和高效,足以在智能手机等个人设备上运行。将相当于韩国总人口约 14 倍的参数量封装进小小的芯片中,使得在手机端即时执行复杂的搜索和决策成为可能[Source 4, Source 10]。
当前进展
目前,EmbeddingGemma 2 已由谷歌 DeepMind 以开放模型的形式发布[Source 9, Source 10]。开发者可以在 Hugging Face 和 Kaggle 等平台上查看并使用该模型的权重(Weight,模型学习到的数据)[Source 3]。该模型采用 Apache 2.0 许可证 (Apache 2.0 license),向所有人开放,可自由用于研究或集成到产品中[Source 10]。
它已准备好与 MediaPipe 或 LiteRT 等谷歌的端侧开发工具相结合,充当帮助设备进行搜索和判断的“AI 的眼睛和耳朵”[Source 4]。
未来展望
未来,用户不仅可以在手机上问“帮我找一下昨天会议里金代理说过的话”,甚至可以提问“找一下昨天会议里共享笔记本屏幕的那个视频片段”,这种多维度的查询将成为可能[Source 7]。此外,无需额外的云端费用,个性化的 AI 助手将能够统筹管理您的所有记录,以个人隐私为中心的“个人 AI 时代”将会加速到来[Source 4]。
MindTickleBytes 的 AI 记者视角
‘EmbeddingGemma 2’ 展示的不仅仅是 AI 变得多么聪明,更在于它能以多深入、多安全的方式融入我们的日常生活。当巨型模型在云端以天价成本运行时,这种轻量且开放的模型在掌上设备中自主思考和搜索的能力,将成为开启真正意义上的“个人 AI 时代”的关键钥匙。
参考资料
- EmbeddingGemma 2 is a best-in-class open model for natively…
- Google launches EmbeddingGemma 2 for on-device AI
- Bring multimodal semantic search to the edge with…
-
[EmbeddingGemma 2: Benchmarks, Specs and How to Run It CellCog](https://cellcog.ai/blog/embeddinggemma-2/) -
[Google launches the next version of its on-device AI model. The Verge](https://www.theverge.com/tech/1005886/google-launches-the-next-version-of-its-on-device-ai-model) - Представляем EmbeddingGemma 2: открытая модель… - YouTube
- EmbeddingGemma 2 announced as Google DeepMind’s first natively…
- DeepMind Debuts EmbeddingGemma 2, Mapping Five Modalities Into…
- EmbeddingGemma 2 is a multimodal embedding model from…
- 视频
- 音频
- 脑电波
- 云端专属模型
- 拥有 7.4 亿参数的端侧模型
- 非公开商业许可
- 压缩并丢弃数据
- 将数据转换为高维空间数值(向量)以理解含义
- 仅将图像转换为文本