谷歌 DeepMind 发布 Gemini Robotics 2 三模型系统,实现机器人全身智能控制、灵巧操作、多机器人协作及端侧快速适应,推动向物理 AGI 前进。
📝 详细摘要
文章详细介绍了 Google DeepMind 在 2026 年 7 月 30 日推出的 Gemini Robotics 2 系列模型,包括视觉-语言-动作(VLA)模型、具身推理(ER)模型和端侧运行(On‑Device)模型。VLA 模型负责从脚到指尖的全身控制和双手灵巧操作;ER 模型充当机器人大脑 Agent,能进行多步骤任务规划、自我修正及多机器人协作;On‑Device 模型则在设备本地运行,仅需数小时即可适应新形态的机器人本体。文中给出了各类任务的成功率范围(全身控制 45.7%-76.3%、Franka Duo 抓取 74.2%-89.6%、多指任务 32%-92%),并介绍了安全基准 ASIMOV-Agentic 以及模型在人类接近时的停机恢复机制。文章强调这是向“物理 AGI”迈进的重要里程碑,机器人未来将能与人类并肩工作解决复杂挑战。
💡 主要观点
- Gemini Robotics 2 包含三个互补模型,分别负责全身控制、具身推理与端侧适应。 VLA 模型实现从脚到指尖的智能全身动作;ER 模型担任大脑 Agent,进行多步骤规划和多机器人协作;On‑Device 模型在设备本地运行,仅需数小时即可适应新机器人本体。
💬 文章金句
- 未来的机器人将能与人类并肩工作,解决复杂挑战。
- 这是我们在迈向所谓的物理 AGI(即让机器人能够完成人类能做的任何事情)道路上的又一个里程碑。
📊 文章信息
AI 初评:82
来源:AI前线
作者:AI前线
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2845
标签: Gemini Robotics, 视觉语言动作模型, 具身推理, 多机器人协作, 端侧AI