機器人看懂影像並自行規劃?『Gemini Robotics ER 2』登場

結合機器人手臂與 AI 技術執行複雜任務的未來感場景
AI Summary

Google 的 Gemini Robotics ER 2 作為具備影像理解與多機器人協作能力的 AI 大腦,能協助機器人自行規劃並執行複雜任務。

試著想像一下:在工廠或物流倉庫中,機器人能夠像人類一樣,「看見」眼前發生的狀況,並據此相互配合。過去的機器人更像是依照預設規則運作的「機械」,但現在,AI 正成為機器人的大腦,全面開啟能自我判斷與活動的時代。

Google 近日公開了全新的 AI 模型——Gemini Robotics ER 2,該模型旨在突破性地提升機器人在實體世界中的推理與規劃能力。Gemini Robotics ER 2 - The Keyword 這項技術不僅讓機器人不再只能盲目遵循既定路徑,更能協助它們自主理解複雜情況並解決問題。

這為什麼很重要?

過去的機器人必須精確地執行他人編寫的代碼指令,絲毫不能出錯。然而,我們身處的現實世界變數太多。若物品位置稍微移動,或作業順序需要調整,傳統機器人往往會無法應對而停擺。

本次發表的技術,其重大意義在於讓機器人具備了「高級大腦」Gemini Robotics ER 2 - Model Card — Google DeepMind 現在,機器人能自行判斷狀況、規劃作業順序,甚至能多台機器人相互合作以達成目標。這意味著我們能與機器人更自然地互動,並建構出更精準、更具彈性的自動化系統。

AD

輕鬆理解

Google 的 Gemini Robotics 2 模型系列主要由三個負責不同角色的部分所構成:Google’s Gemini Robotics 2 Achieves 92% Hand Precision

  1. Robotics 2(動作模型):負責機器人實體動作的「手腳」。
  2. Robotics ER 2(推理與規劃模型):理解周遭狀況並安排作業順序的「大腦」。
  3. Robotics On-Device 2(輕量化動作模型):無需網路連線即可立即反應的「反射神經」。
簡單的比喻:就像我們在下廚時有「計劃要做什麼的腦袋」與「實際切菜炒菜的雙手」,Google 為機器人建立了一套相同的機制。特別是這次更強大的 ER 2 模型,基於 Google 的高性能 AI「Gemini 3.5 Flash」打造,在空間理解力上表現優異。[Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview)
機器人甚至能透過觀察即時輸入的影像數據,自行判斷作業進度。[Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) 這無異於賦予了機器人人類般的視覺認知能力。

進展到什麼程度了?

目前 Gemini Robotics ER 2 具備機器人視覺空間推理、影像情境辨識,以及指揮多台機器人同時協作(協調多台機器人動作)的功能。Gemini Robotics ER 2 - The Keyword

在近期的測試中,該模型達成驚人的 92% 手部精準度,證明了其處理極為細膩與複雜作業的能力。Google’s Gemini Robotics 2 Achieves 92% Hand Precision 雖然前代模型 ER 1.6 在空間推理與工具使用能力上已有顯著進步,但 ER 2 被認為將機器人的智慧又提升了一個層次。Gemini Robotics ER 1.6 — Google DeepMind

當然,Google 也呼籲在使用此強大技術時需保持警惕。特別是在醫療或安全相關領域,必須謹慎對待,目前該技術仍是在人類監督下運用。Gemini Robotics ER 2 - Model Card — Google DeepMind

未來展望

未來,機器人將能更精準地聽懂我們日常口語中的複雜指令。像「把那邊的箱子搬到右邊的桶子裡」這種自然的命令,機器人便能透過影像分析並自行規劃路徑來執行,這一天已經不遠了。此外,我們也能期待多台機器人相互配合,以更快的速度完成龐大作業。機器人正迅速進化,成為對人類生活真正有實質幫助的工具。

MindTickleBytes 的 AI 記者觀點

這次為機器人注入「思考能力」的模型,正將機器人從單純的自動化機械轉變為「具備行動力的智慧體」。隨著技術日趨成熟,人類與機器人的合作模式勢必會變得更加精準且自然。

參考資料

  1. [Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview)
  2. Gemini Robotics 2
  3. [Gemini Robotics: Advancing Physical AI with Vision-Language-Action models Encord](https://encord.com/blog/gemini-robotics/)
  4. Gemini Robotics ER 1.6: Enhanced Embodied Reasoning — Google DeepMind
  5. Gemini Robotics ER 1.6 — Google DeepMind
  6. Gemini Robotics ER-1.6 enhances reasoning to help robots navigate real-world tasks.
  7. Gemini Robotics: Bringing AI into the Physical World
  8. Gemini Robotics ER 2 - The Keyword
  9. Gemini Robotics ER 2 - Model Card — Google DeepMind
  10. Google’s Gemini Robotics 2 Achieves 92% Hand Precision
  11. Powering Smart Robots With Google Gemini Robotics Models
  12. [Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress)
  13. Google unveils Gemini Robotics and Gemini Robotics ER for…
  14. Google Unveils Gemini Robotics: AI Model Enabling Human-like…
  15. [Google DeepMind launches Gemini Robotics 1.5, a new AI… LinkedIn](https://www.linkedin.com/posts/allip-lamah-34241a255_devfullstack-joinme-googledeepmindlaunchesgeminirobotics-activity-7378734866953089025-VbWP)
AD
測試你的理解
Q1. 下列何者並非 Gemini Robotics ER 2 的核心功能?
  • 即時追蹤基於影像的作業進度
  • 指揮多機器人協作
  • 在無網路連線下執行所有作業
ER 2 模型專注於影像理解與判斷,而在無網路連線下運作的輕量化模型為『Robotics On-Device 2』。
Q2. 擔任機器人『大腦』角色的模型是什麼?
  • Robotics 2(動作模型)
  • Robotics ER 2(推理與規劃模型)
  • Robotics On-Device 2
ER 2 模型負責理解周遭環境並組織作業順序。
Q3. 機器人 2 模型系列所達成並為人所知的數據為何?
  • 92% 的手部精準度
  • 85% 的作業成功率
  • 95% 的識別速度
根據最新報導,Robotics 2 模型已達成 92% 的手部精準度。