← 回總覽

三连发!阿里发布首个具身大模型 Qwen-Robot 系列

📅 2026-06-16 12:39 量子位的朋友们 人工智能 2 分鐘 1376 字 評分: 82
具身智能 VLA 模型 VLN 模型 世界模型 机器人
📌 一句话摘要 阿里发布千问具身智能大模型系列 Qwen-Robot,包含 VLA 操作、VLN 导航和世界模型三大模型,为机器人提供通用底座。 📝 详细摘要 文章报道了阿里巴巴于 6 月 16 日发布的千问具身智能大模型系列 Qwen-Robot。该系列包含三个核心模型:VLA 操作模型 Qwen-RobotManip,通过 80 维统一动作表征和相对位置操作,解决迁移能力不足的痛点,并在 RoboChallenge 真机测评中取得领先;VLN 导航模型 Qwen-RobotNav,统一五大导航任务,创新任务自适应观察机制,支持多种智能体框架;世界模型 Qwen-RobotWorld,可

📌 一句话摘要

阿里发布千问具身智能大模型系列 Qwen-Robot,包含 VLA 操作、VLN 导航和世界模型三大模型,为机器人提供通用底座。

📝 详细摘要

文章报道了阿里巴巴于 6 月 16 日发布的千问具身智能大模型系列 Qwen-Robot。该系列包含三个核心模型:VLA 操作模型 Qwen-RobotManip,通过 80 维统一动作表征和相对位置操作,解决迁移能力不足的痛点,并在 RoboChallenge 真机测评中取得领先;VLN 导航模型 Qwen-RobotNav,统一五大导航任务,创新任务自适应观察机制,支持多种智能体框架;世界模型 Qwen-RobotWorld,可模拟和预测机器人动作,缓解训练数据不足问题。文章指出,这是千问从数字智能体迈向物理智能体的重要一步,为不同形态机器人的真实落地提供了通用底座。

💡 主要观点

- Qwen-Robot 系列包含 VLA 操作、VLN 导航和世界模型三大模型,可单独或协同部署。 三个模型分别对应机器人的操作、移动和思考能力,通过统一的自然语言指令协同工作,为不同形态机器人提供通用底座。

Qwen-RobotManip 通过 80 维统一动作表征和相对位置操作,解决了传统 VLA 模型迁移能力不足的问题。 该模型仅基于开源数据训练,在 RoboChallenge 真机测评中排名前二,在拧水龙头、插网线等 30 项任务中表现稳定。
Qwen-RobotNav 创新任务自适应观察机制,统一五大导航任务,原生支持多种智能体框架。 该模型解决了传统 VLN 模型记忆策略死板的困境,让机器人能边走边看边思考,并可作为通用接口被上层模型调用。
Qwen-RobotWorld 世界模型可模拟和预测机器人动作,缓解训练数据不足的困难。 该模型基于对物理规律的理解,能生成视频数据训练模型,并在执行动作前推演未来轨迹,提升操作精准度。

💬 文章金句

- Qwen-Robot 通过三类关键的大模型设计和训练,让模型能更好地听懂人类自然语言、感知三维环境、了解物理规律,从而指挥机器人在真实世界中自主执行复杂操作和精准移动,甚至完成从未见过的任务。

  • Qwen-RobotManip 只需数步反馈即可自动适配,性能稳定高效,像老司机坐进陌生车辆,试几脚油门就能上路。

📊 文章信息

AI 初评:82

来源:量子位

作者:量子位的朋友们

分类:人工智能

语言:中文

阅读时间:8 分钟

字数:1876

标签: 具身智能, VLA 模型, VLN 模型, 世界模型, 机器人

阅读完整文章

查看原文 → 發佈: 2026-06-16 12:39:39 收錄: 2026-06-16 18:00:55

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。