← 回總覽

谷歌连发三模型,把机器人调教成“全能打工人”!几小时速配、从头控到脚,还能“组团”开干

📅 2026-07-31 15:20 AI前线 人工智能 2 分鐘 1355 字 評分: 82
Gemini Robotics 视觉语言动作模型 具身推理 多机器人协作 端侧AI
📌 一句话摘要 谷歌 DeepMind 发布 Gemini Robotics 2 三模型系统,实现机器人全身智能控制、灵巧操作、多机器人协作及端侧快速适应,推动向物理 AGI 前进。 📝 详细摘要 文章详细介绍了 Google DeepMind 在 2026 年 7 月 30 日推出的 Gemini Robotics 2 系列模型,包括视觉-语言-动作(VLA)模型、具身推理(ER)模型和端侧运行(On‑Device)模型。VLA 模型负责从脚到指尖的全身控制和双手灵巧操作;ER 模型充当机器人大脑 Agent,能进行多步骤任务规划、自我修正及多机器人协作;On‑Device 模型则在设备

📌 一句话摘要

谷歌 DeepMind 发布 Gemini Robotics 2 三模型系统,实现机器人全身智能控制、灵巧操作、多机器人协作及端侧快速适应,推动向物理 AGI 前进。

📝 详细摘要

文章详细介绍了 Google DeepMind 在 2026 年 7 月 30 日推出的 Gemini Robotics 2 系列模型,包括视觉-语言-动作(VLA)模型、具身推理(ER)模型和端侧运行(On‑Device)模型。VLA 模型负责从脚到指尖的全身控制和双手灵巧操作;ER 模型充当机器人大脑 Agent,能进行多步骤任务规划、自我修正及多机器人协作;On‑Device 模型则在设备本地运行,仅需数小时即可适应新形态的机器人本体。文中给出了各类任务的成功率范围(全身控制 45.7%-76.3%、Franka Duo 抓取 74.2%-89.6%、多指任务 32%-92%),并介绍了安全基准 ASIMOV-Agentic 以及模型在人类接近时的停机恢复机制。文章强调这是向“物理 AGI”迈进的重要里程碑,机器人未来将能与人类并肩工作解决复杂挑战。

💡 主要观点

- Gemini Robotics 2 包含三个互补模型,分别负责全身控制、具身推理与端侧适应。 VLA 模型实现从脚到指尖的智能全身动作;ER 模型担任大脑 Agent,进行多步骤规划和多机器人协作;On‑Device 模型在设备本地运行,仅需数小时即可适应新机器人本体。

系统展示出高水平的灵巧操作和任务成功率,覆盖从基础抓取到精细五指动作。 在全身操控类别中成功率 45.7%-76.3%,Franka Duo 抓取器 74.2%-89.6%,多指任务 32%-92%,表明模型能处理从粗糙到极度精细的各种操作。
安全机制与多机器人协作被纳入设计,支持实时风险感知与任务中止。 通过 ASIMOV-Agentic 基准评估模型拒绝不安全指令及主动请求人工干预的能力;ER 模型可检测人类靠近并停机,区域无人后自主恢复,提升协作安全性。

💬 文章金句

- 未来的机器人将能与人类并肩工作,解决复杂挑战。

  • 这是我们在迈向所谓的物理 AGI(即让机器人能够完成人类能做的任何事情)道路上的又一个里程碑。

📊 文章信息

AI 初评:82

来源:AI前线

作者:AI前线

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2845

标签: Gemini Robotics, 视觉语言动作模型, 具身推理, 多机器人协作, 端侧AI

阅读完整文章

查看原文 → 發佈: 2026-07-31 15:20:00 收錄: 2026-08-01 02:00:07

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。