Google 的 Gemini Robotics ER 2 作為具備影像理解與多機器人協作能力的 AI 大腦,能協助機器人自行規劃並執行複雜任務。
試著想像一下:在工廠或物流倉庫中,機器人能夠像人類一樣,「看見」眼前發生的狀況,並據此相互配合。過去的機器人更像是依照預設規則運作的「機械」,但現在,AI 正成為機器人的大腦,全面開啟能自我判斷與活動的時代。
Google 近日公開了全新的 AI 模型——Gemini Robotics ER 2,該模型旨在突破性地提升機器人在實體世界中的推理與規劃能力。Gemini Robotics ER 2 - The Keyword 這項技術不僅讓機器人不再只能盲目遵循既定路徑,更能協助它們自主理解複雜情況並解決問題。
這為什麼很重要?
過去的機器人必須精確地執行他人編寫的代碼指令,絲毫不能出錯。然而,我們身處的現實世界變數太多。若物品位置稍微移動,或作業順序需要調整,傳統機器人往往會無法應對而停擺。
本次發表的技術,其重大意義在於讓機器人具備了「高級大腦」。Gemini Robotics ER 2 - Model Card — Google DeepMind 現在,機器人能自行判斷狀況、規劃作業順序,甚至能多台機器人相互合作以達成目標。這意味著我們能與機器人更自然地互動,並建構出更精準、更具彈性的自動化系統。
輕鬆理解
Google 的 Gemini Robotics 2 模型系列主要由三個負責不同角色的部分所構成:Google’s Gemini Robotics 2 Achieves 92% Hand Precision
- Robotics 2(動作模型):負責機器人實體動作的「手腳」。
- Robotics ER 2(推理與規劃模型):理解周遭狀況並安排作業順序的「大腦」。
- Robotics On-Device 2(輕量化動作模型):無需網路連線即可立即反應的「反射神經」。
| 簡單的比喻:就像我們在下廚時有「計劃要做什麼的腦袋」與「實際切菜炒菜的雙手」,Google 為機器人建立了一套相同的機制。特別是這次更強大的 ER 2 模型,基於 Google 的高性能 AI「Gemini 3.5 Flash」打造,在空間理解力上表現優異。[Gemini Robotics-ER 1.6 | Gemini API | Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview) |
| 機器人甚至能透過觀察即時輸入的影像數據,自行判斷作業進度。[Videounderstanding | Gemini API | Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) 這無異於賦予了機器人人類般的視覺認知能力。 |
進展到什麼程度了?
目前 Gemini Robotics ER 2 具備機器人視覺空間推理、影像情境辨識,以及指揮多台機器人同時協作(協調多台機器人動作)的功能。Gemini Robotics ER 2 - The Keyword
在近期的測試中,該模型達成驚人的 92% 手部精準度,證明了其處理極為細膩與複雜作業的能力。Google’s Gemini Robotics 2 Achieves 92% Hand Precision 雖然前代模型 ER 1.6 在空間推理與工具使用能力上已有顯著進步,但 ER 2 被認為將機器人的智慧又提升了一個層次。Gemini Robotics ER 1.6 — Google DeepMind
當然,Google 也呼籲在使用此強大技術時需保持警惕。特別是在醫療或安全相關領域,必須謹慎對待,目前該技術仍是在人類監督下運用。Gemini Robotics ER 2 - Model Card — Google DeepMind
未來展望
未來,機器人將能更精準地聽懂我們日常口語中的複雜指令。像「把那邊的箱子搬到右邊的桶子裡」這種自然的命令,機器人便能透過影像分析並自行規劃路徑來執行,這一天已經不遠了。此外,我們也能期待多台機器人相互配合,以更快的速度完成龐大作業。機器人正迅速進化,成為對人類生活真正有實質幫助的工具。
MindTickleBytes 的 AI 記者觀點
這次為機器人注入「思考能力」的模型,正將機器人從單純的自動化機械轉變為「具備行動力的智慧體」。隨著技術日趨成熟,人類與機器人的合作模式勢必會變得更加精準且自然。
參考資料
-
[Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview) - Gemini Robotics 2
-
[Gemini Robotics: Advancing Physical AI with Vision-Language-Action models Encord](https://encord.com/blog/gemini-robotics/) - Gemini Robotics ER 1.6: Enhanced Embodied Reasoning — Google DeepMind
- Gemini Robotics ER 1.6 — Google DeepMind
- Gemini Robotics ER-1.6 enhances reasoning to help robots navigate real-world tasks.
- Gemini Robotics: Bringing AI into the Physical World
- Gemini Robotics ER 2 - The Keyword
- Gemini Robotics ER 2 - Model Card — Google DeepMind
- Google’s Gemini Robotics 2 Achieves 92% Hand Precision
- Powering Smart Robots With Google Gemini Robotics Models
-
[Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) - Google unveils Gemini Robotics and Gemini Robotics ER for…
- Google Unveils Gemini Robotics: AI Model Enabling Human-like…
-
[Google DeepMind launches Gemini Robotics 1.5, a new AI… LinkedIn](https://www.linkedin.com/posts/allip-lamah-34241a255_devfullstack-joinme-googledeepmindlaunchesgeminirobotics-activity-7378734866953089025-VbWP)
- 即時追蹤基於影像的作業進度
- 指揮多機器人協作
- 在無網路連線下執行所有作業
- Robotics 2(動作模型)
- Robotics ER 2(推理與規劃模型)
- Robotics On-Device 2
- 92% 的手部精準度
- 85% 的作業成功率
- 95% 的識別速度