机器人竟然能看视频并自主规划?“Gemini Robotics ER 2”震撼登场

机械臂与AI技术相结合,执行复杂任务的未来感场景
AI Summary

谷歌的 Gemini Robotics ER 2 作为AI大脑,具备视频理解与多机器人协作能力,能够辅助机器人自主规划并执行复杂任务。

想象一下:在工厂或物流仓库里,机器人像人类一样,“亲眼”观察着眼前发生的各种情况,并据此相互协作。过去,机器人更接近于按照预设规则运动的“机器”,但现在,AI正在成为机器人的大脑,一个能够自主判断并行动的时代正在全面开启。

谷歌近期发布了全新的AI模型——Gemini Robotics ER 2,它将显著提升机器人在物理世界中的推理与规划能力。Gemini Robotics ER 2 - The Keyword 这项技术不仅让机器人摆脱了固定路径的束缚,更能帮助它们自主理解复杂环境并解决实际问题。

为什么这很重要?

以往的机器人必须严格遵守人工编写的指令,稍有偏差便无法运作。然而,我们所处的现实世界存在太多变量。一旦物品位置略有变动,或者需要更改作业顺序,传统的机器人往往会陷入瘫痪,只能停止工作。

此次发布的技术意义深远,因为它赋予了机器人“高级大脑”。Gemini Robotics ER 2 - Model Card — Google DeepMind 现在,机器人可以自主判断情况、编排任务顺序,并实现多台机器人之间的相互配合以达成目标。这意味着我们不仅能与机器人进行更自然的交互,还能构建出更加精密、灵活的自动化系统。

AD

浅显易懂的解读

谷歌的 Gemini Robotics 2 模型系列主要由三个功能板块构成:Google’s Gemini Robotics 2 Achieves 92% Hand Precision

  1. Robotics 2 (动作模型):负责机器人物理运动的“手脚”。
  2. Robotics ER 2 (推理与规划模型):负责理解周边状况并确定工作顺序的“大脑”。
  3. Robotics On-Device 2 (轻量级动作模型):无需连接网络即可立即做出反应的“反射神经”。
打个比方,就像我们做饭时既需要“规划要做什么的头脑”,也需要“实际切菜翻炒的双手”,谷歌为机器人打造了同样的架构体系。特别是此次增强的 ER 2 模型,基于谷歌高性能AI“Gemini 3.5 Flash”构建,具备极强的空间理解力。[Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview)
机器人可以通过实时接收的视频数据,自行判断当前任务的进度。[Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress) 这无异于为机器人安装了人类的“双眼”,赋予了它们视觉认知能力。

发展现状如何?

目前,Gemini Robotics ER 2 已具备视觉空间推理、视频情境感知,以及多机器人协调指挥(调度多台机器人的动作)的功能。Gemini Robotics ER 2 - The Keyword

在近期的测试中,该模型实现了高达 92% 的手部精准度,证明了其在极其细致复杂的操作中同样游刃有余。Google’s Gemini Robotics 2 Achieves 92% Hand Precision 虽然前代模型 ER 1.6 在空间推理和工具使用方面已有长足进步,但 ER 2 被公认为将机器人的智能提升到了一个新的台阶。Gemini Robotics ER 1.6 — Google DeepMind

当然,谷歌也对这项强大技术的应用提出了警示。特别是在与医疗或安全直接相关的领域,必须采取谨慎态度,目前该技术仍处于人类监督下的应用阶段。Gemini Robotics ER 2 - Model Card — Google DeepMind

未来展望

展望未来,机器人将能够更好地理解我们日常口语中表达的复杂指令。只需一句自然的话语,如“把那边的箱子搬过来,装进右边的桶里”,机器人便能通过分析视频、自主建立规划并执行任务,这一天已经不远了。更进一步,我们还可以期待多台机器人协同作战,以更快的速度处理宏大繁杂的任务。机器人正在迅速进化,成为真正能够为人类生活提供实质性帮助的有力工具。

MindTickleBytes AI 记者观点

此次发布的新模型为机器人注入了“思考之力”,正在将机器人从单一的自动化设备转变为“能够行动的智慧体”。随着技术不断演进,人类与机器人的协作方式也将变得愈发精准且自然。

参考资料

  1. [Gemini Robotics-ER 1.6 Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-overview)
  2. Gemini Robotics 2
  3. [Gemini Robotics: Advancing Physical AI with Vision-Language-Action models Encord](https://encord.com/blog/gemini-robotics/)
  4. Gemini Robotics ER 1.6: Enhanced Embodied Reasoning — Google DeepMind
  5. Gemini Robotics ER 1.6 — Google DeepMind
  6. Gemini Robotics ER-1.6 enhances reasoning to help robots navigate real-world tasks.
  7. Gemini Robotics: Bringing AI into the Physical World
  8. Gemini Robotics ER 2 - The Keyword
  9. Gemini Robotics ER 2 - Model Card — Google DeepMind
  10. Google’s Gemini Robotics 2 Achieves 92% Hand Precision
  11. Powering Smart Robots With Google Gemini Robotics Models
  12. [Videounderstanding Gemini API Google AI for Developers](https://ai.google.dev/gemini-api/docs/robotics-video-progress)
  13. Google unveils Gemini Robotics and Gemini Robotics ER for…
  14. Google Unveils Gemini Robotics: AI Model Enabling Human-like…
  15. [Google DeepMind launches Gemini Robotics 1.5, a new AI… LinkedIn](https://www.linkedin.com/posts/allip-lamah-34241a255_devfullstack-joinme-googledeepmindlaunchesgeminirobotics-activity-7378734866953089025-VbWP)
AD
测试你的理解
Q1. 以下哪项不是 Gemini Robotics ER 2 的核心功能?
  • 基于实时视频的任务进度跟踪
  • 多机器人协作指挥
  • 无需联网即可执行所有操作
ER 2 模型专精于视频理解与判断,而无需联网运行的轻量级模型是“Robotics On-Device 2”。
Q2. 哪种模型充当了机器人的“大脑”角色?
  • Robotics 2 (动作模型)
  • Robotics ER 2 (推理与规划模型)
  • Robotics On-Device 2
ER 2 模型负责理解周边环境并组织任务顺序。
Q3. Robotics 2 模型系列中提到的成就指标是?
  • 92% 的手部精准度
  • 85% 的任务成功率
  • 95% 的识别速度
据最新报道,Robotics 2 模型已达到 92% 的手部精准度。