📌 一句话摘要 文章指出机器人在演示中动作缓慢的根本原因在于“大脑”尚未跨越实用门槛,缺乏对自身身体的本体认知,因而无法在真实世界中快速可靠地行动。 📝 详细摘要 文章通过讯飞新成立的爻方智能及其技术报告 iFLYTEK-Embodied-Omni,分析了当前机器人大脑技术路线的不足:VLA 仅是即时反应系统,缺乏对后果的推演;世界模型虽能预测未来画面却易产生误差累积且缺少本体认知;爻方提出通过引入视频生成模型进行未来状态预测、将逆运动学作为训练任务以培养身体直觉,并采用大脑-小脑协同架构以及高比例的具身大脑数据(轨迹、空间推理等)来弥补数据稀缺问题。实验结果显示该方法在多基准上优于现有
📌 一句话摘要
文章指出机器人在演示中动作缓慢的根本原因在于“大脑”尚未跨越实用门槛,缺乏对自身身体的本体认知,因而无法在真实世界中快速可靠地行动。
📝 详细摘要
文章通过讯飞新成立的爻方智能及其技术报告 iFLYTEK-Embodied-Omni,分析了当前机器人大脑技术路线的不足:VLA 仅是即时反应系统,缺乏对后果的推演;世界模型虽能预测未来画面却易产生误差累积且缺少本体认知;爻方提出通过引入视频生成模型进行未来状态预测、将逆运动学作为训练任务以培养身体直觉,并采用大脑-小脑协同架构以及高比例的具身大脑数据(轨迹、空间推理等)来弥补数据稀缺问题。实验结果显示该方法在多基准上优于现有 VLA 和 WAM 方法,且已在真机上验证可行。文章进一步阐释了讯飞多年在语音等领域的工程化积累如何为具身智能的落地提供基础,并指出公司名称“爻方”蕴含阴阳变化与“变中求方”的哲学内涵。
💡 主要观点
-
当前机器人大脑的主要瓶颈在于缺乏对自身身体的本体认知,导致只能在精心布置的 Demo 环境中缓慢运行。
文章指出,机器人之所以在展示中动作缓慢,并非因为身体机能不足,而是“大脑”尚未跨越实用门槛,无法在真实物理世界中进行可靠的动作决策。
VLA(Vision‑Language‑Action)架构仅是即时反应系统,无法对动作后果进行推演,因而容易出错。
VLA 只关注‘当下怎么做’,不考虑执行后世界状态的变化,类似于只看到红灯就踩刹车却无法预判雨天打滑的风险。
null
预测画面与动作的串行结构导致视觉误差直接传导到动作端;此外,现有世界模型未将身体自身的能力与限制纳入训练目标,因而‘预判世界却不认识自己’。
爻方的 iFLYTEK‑Embodied‑Omni 引入视频生成模型进行未来状态预测,并将逆运动学作为训练任务,以培养机器人对自身身体的直觉。
通过让模型先在脑中预演动作后果,再利用逆运动学任务让模型自行推导关节运动,从而实现‘先想后动’并提升对自身身体能力的认识。
null
三个模块通过共享多模态自注意力机制实时交互,使规划与执行能够并行进行,减少误差累积,提升动作的速度与稳定性。
训练数据中近一半为具身大脑数据(轨迹、空间推理、任务规划等),无需真机采集即可提升模型的空间感与规划能力。
通过大量使用结构化的具身数据,模型在数据稀缺的情况下仍能获得强大的泛化表现,实验基准上优于现有 VLA 和 WAM 方法。
实验结果表明该方法在 LIBERO‑Plus 零样本基准、RoboTwin 2.0 双臂协同基准及长时序任务上均取得高成功率,且在真机上已验证可行。
在多种环境扰动下平均成功率达 89.6%,双臂协同任务在标准与随机环境下分别达 93.68% 和 93.16%,长时序任务甚至在更复杂环境中表现更佳,证明所提出架构与数据策略的有效性。
💬 文章金句
- "不是不能快,是怕出错。速度是可以调快的,调快以后出错概率就会增加,给别人演示的时候就会掉链子。"
- "现在的世界模型,更多还是在关注预测这一点。不管是世界模型还是之前的 policy,都没办法通过任务去增加对本体的认识。"
- "以往的模型没办法通过任务去认识本体,爻方干脆把逆运动学做成了任务本身。"
- "量产之前,首先要跨过实用门槛。盲目上线,最后牺牲的就是品牌,第一个吃螃蟹的人,就变成了先烈。"
- "阴一半、阳一半,这不就是 0 和 1 嘛,堪称中国最早的二进制。"
📊 文章信息
AI 初评:83
来源:量子位
作者:一水
分类:人工智能
语言:中文
阅读时间:23 分钟
字数:5587
标签:
具身智能, 机器人大脑, VLA, 世界模型, 本体认知
阅读完整文章