Google DeepMind 公開了輕量且開放的多模態嵌入模型「EmbeddingGemma 2」,能在同一空間內處理文字、代碼、圖像、影片與音訊。
想像一下。今天早上,您的智慧型手機裡累積了數千張照片、數十個影片,還有零星錄製的會議音訊備忘錄。若在以往,您得一一翻找,或將數據傳輸至雲端交給 AI 服務分析。但現在,只需輸入一次「搜尋關鍵字」,手機內的所有資訊即將串聯。Google DeepMind 於 2026 年 10 月 6 日公開的新模型「EmbeddingGemma 2」,正開啟了這項可能性[Source 3, Source 5, Source 10]。
為何這很重要?
以往的 AI 模型大多專注於特定數據形式,如文字就擅長文字,圖像就擅長圖像。然而,我們生活的現實遠比這複雜。理解影片中的情境,或找出與錄音內容相關的文件,都是極為常見的需求。
最關鍵的變化在於「隱私」。EmbeddingGemma 2 的設計初衷,是不將個人的珍貴資訊傳送至外部雲端伺服器,而是直接在手機或筆電等個人裝置(端側,On-device)上解決[Source 4]。這不僅保護了隱私,更能在無需網路連線的情況下,享受快速且零延遲(ultra-low-latency)的 AI 體驗[Source 4]。
輕鬆理解:將數據變為「座標」的魔法
要了解 EmbeddingGemma 2,首先必須知道「嵌入(Embedding)」的概念。
簡單比喻,這就像將世界上所有的書分類放入圖書館。「嵌入」是一項技術,將文字、代碼、圖像、影片與音訊等不同形式的數據,並列放置在名為「數值化座標(768 維向量空間)」的統一空間中,如同圖書館裡的書籍[Source 5, Source 10, Source 11]。
- 換句話說,AI 透過此模型,能瞬間察覺「狗吠聲(音訊)」、「狗奔跑的影片(影片)」與「小狗照片(圖像)」其實都蘊含著相同的意義(狗)[Source 9, Source 11]。
- 就如同我們學習外語時,會將「Apple」這個詞與「紅色蘋果圖像」連結記憶一樣,該模型能將從文字到影片等不同的模態(Modality,數據類型)串聯起來進行理解[Source 5, Source 11]。
EmbeddingGemma 2 擁有 7.4 億個參數(Parameter,AI 學習到的可調節數值)[Source 4, Source 7, Source 10]。這意味著它足夠輕量與高效,足以在智慧型手機等個人裝置上執行。將約為韓國總人口數 14 倍的參數放入小型晶片中,便能直接在手機內即時完成複雜的搜尋與決策[Source 4, Source 10]。
現況
目前,EmbeddingGemma 2 已由 Google DeepMind 作為開放模型公開[Source 9, Source 10]。開發者可透過 Hugging Face 與 Kaggle 等平台,查閱並直接運用該模型的權重(Weight,模型學習到的數據)[Source 3]。透過採用 Apache 2.0 授權(Apache 2.0 license),開放任何人自由研究並運用於產品中[Source 10]。
該模型已與 MediaPipe 或 LiteRT 等 Google 的端側開發工具結合,隨時準備好擔任協助裝置內部搜尋與判斷的「AI 之眼與耳」角色[Source 4]。
未來展望
未來,我們不僅能對手機詢問「找出昨天會議中金代理說過的話」,更將能實現「找出昨天會議中分享筆電螢幕的影片段落」這類多維度提問[Source 7]。同時,個人化 AI 助理將能在無需支付額外雲端費用的情況下,整合管理並尋找您的所有記錄,加速進入「以個人資訊為中心的 AI 時代」[Source 4]。
MindTickleBytes 的 AI 記者觀點
「EmbeddingGemma 2」展示了 AI 技術不僅是在變聰明,更展現了它能多深入且安全地融入我們的日常生活。當巨型模型在雲端以天文數字成本運作時,像這樣輕量且開放的模型能在我們手中的裝置上自主思考與搜尋,將成為開啟真正意義上的「個人 AI 時代」的關鍵鑰匙。
參考資料
- EmbeddingGemma 2 is a best-in-class open model for natively…
- Google launches EmbeddingGemma 2 for on-device AI
- Bring multimodal semantic search to the edge with…
-
[EmbeddingGemma 2: Benchmarks, Specs and How to Run It CellCog](https://cellcog.ai/blog/embeddinggemma-2/) -
[Google launches the next version of its on-device AI model. The Verge](https://www.theverge.com/tech/1005886/google-launches-the-next-version-of-its-on-device-ai-model) - Представляем EmbeddingGemma 2: открытая модель… - YouTube
- EmbeddingGemma 2 announced as Google DeepMind’s first natively…
- DeepMind Debuts EmbeddingGemma 2, Mapping Five Modalities Into…
- EmbeddingGemma 2 is a multimodal embedding model from…
- 影片
- 音訊
- 腦波
- 雲端專用模型
- 具備 7.4 億參數的端側模型
- 不公開商業授權
- 壓縮並丟棄數據
- 將數據轉換為高維空間的數值(向量)以解析語意
- 僅將圖像轉換為文字