谷歌的 Gemini Robotics ER 2 作为AI大脑,具备视频理解与多机器人协作能力,能够辅助机器人自主规划并执行复杂任务。
想象一下:在工厂或物流仓库里,机器人像人类一样,“亲眼”观察着眼前发生的各种情况,并据此相互协作。过去,机器人更接近于按照预设规则运动的“机器”,但现在,AI正在成为机器人的大脑,一个能够自主判断并行动的时代正在全面开启。
谷歌近期发布了全新的AI模型——Gemini Robotics ER 2,它将显著提升机器人在物理世界中的推理与规划能力。Gemini Robotics ER 2 - The Keyword 这项技术不仅让机器人摆脱了固定路径的束缚,更能帮助它们自主理解复杂环境并解决实际问题。
为什么这很重要?
以往的机器人必须严格遵守人工编写的指令,稍有偏差便无法运作。然而,我们所处的现实世界存在太多变量。一旦物品位置略有变动,或者需要更改作业顺序,传统的机器人往往会陷入瘫痪,只能停止工作。
此次发布的技术意义深远,因为它赋予了机器人“高级大脑”。Gemini Robotics ER 2 - Model Card — Google DeepMind 现在,机器人可以自主判断情况、编排任务顺序,并实现多台机器人之间的相互配合以达成目标。这意味着我们不仅能与机器人进行更自然的交互,还能构建出更加精密、灵活的自动化系统。
浅显易懂的解读
谷歌的 Gemini Robotics 2 模型系列主要由三个功能板块构成:Google’s Gemini Robotics 2 Achieves 92% Hand Precision
- Robotics 2 (动作模型):负责机器人物理运动的“手脚”。
- Robotics ER 2 (推理与规划模型):负责理解周边状况并确定工作顺序的“大脑”。
- Robotics On-Device 2 (轻量级动作模型):无需连接网络即可立即做出反应的“反射神经”。
| 打个比方,就像我们做饭时既需要“规划要做什么的头脑”,也需要“实际切菜翻炒的双手”,谷歌为机器人打造了同样的架构体系。特别是此次增强的 ER 2 模型,基于谷歌高性能AI“Gemini 3.5 Flash”构建,具备极强的空间理解力。[Gemini Robotics-ER 1.6 | Gemini API | Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview) |
| 机器人可以通过实时接收的视频数据,自行判断当前任务的进度。[Videounderstanding | Gemini API | Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) 这无异于为机器人安装了人类的“双眼”,赋予了它们视觉认知能力。 |
发展现状如何?
目前,Gemini Robotics ER 2 已具备视觉空间推理、视频情境感知,以及多机器人协调指挥(调度多台机器人的动作)的功能。Gemini Robotics ER 2 - The Keyword
在近期的测试中,该模型实现了高达 92% 的手部精准度,证明了其在极其细致复杂的操作中同样游刃有余。Google’s Gemini Robotics 2 Achieves 92% Hand Precision 虽然前代模型 ER 1.6 在空间推理和工具使用方面已有长足进步,但 ER 2 被公认为将机器人的智能提升到了一个新的台阶。Gemini Robotics ER 1.6 — Google DeepMind
当然,谷歌也对这项强大技术的应用提出了警示。特别是在与医疗或安全直接相关的领域,必须采取谨慎态度,目前该技术仍处于人类监督下的应用阶段。Gemini Robotics ER 2 - Model Card — Google DeepMind
未来展望
展望未来,机器人将能够更好地理解我们日常口语中表达的复杂指令。只需一句自然的话语,如“把那边的箱子搬过来,装进右边的桶里”,机器人便能通过分析视频、自主建立规划并执行任务,这一天已经不远了。更进一步,我们还可以期待多台机器人协同作战,以更快的速度处理宏大繁杂的任务。机器人正在迅速进化,成为真正能够为人类生活提供实质性帮助的有力工具。
MindTickleBytes AI 记者观点
此次发布的新模型为机器人注入了“思考之力”,正在将机器人从单一的自动化设备转变为“能够行动的智慧体”。随着技术不断演进,人类与机器人的协作方式也将变得愈发精准且自然。
参考资料
-
[Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview) - Gemini Robotics 2
-
[Gemini Robotics: Advancing Physical AI with Vision-Language-Action models Encord](https://encord.com/blog/gemini-robotics/) - Gemini Robotics ER 1.6: Enhanced Embodied Reasoning — Google DeepMind
- Gemini Robotics ER 1.6 — Google DeepMind
- Gemini Robotics ER-1.6 enhances reasoning to help robots navigate real-world tasks.
- Gemini Robotics: Bringing AI into the Physical World
- Gemini Robotics ER 2 - The Keyword
- Gemini Robotics ER 2 - Model Card — Google DeepMind
- Google’s Gemini Robotics 2 Achieves 92% Hand Precision
- Powering Smart Robots With Google Gemini Robotics Models
-
[Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) - Google unveils Gemini Robotics and Gemini Robotics ER for…
- Google Unveils Gemini Robotics: AI Model Enabling Human-like…
-
[Google DeepMind launches Gemini Robotics 1.5, a new AI… LinkedIn](https://www.linkedin.com/posts/allip-lamah-34241a255_devfullstack-joinme-googledeepmindlaunchesgeminirobotics-activity-7378734866953089025-VbWP)
- 基于实时视频的任务进度跟踪
- 多机器人协作指挥
- 无需联网即可执行所有操作
- Robotics 2 (动作模型)
- Robotics ER 2 (推理与规划模型)
- Robotics On-Device 2
- 92% 的手部精准度
- 85% 的任务成功率
- 95% 的识别速度