美团技术团队提出 LARYBench,首个系统化评估隐式动作表征质量的基准,实验发现通用视觉模型在动作泛化上显著优于具身专项模型。
📝 详细摘要
本文由美团技术团队发布,介绍了他们提出的 LARYBench(Latent Action Representation Yielding Benchmark),这是一个用于系统化评估隐式动作表征质量的基准。文章指出,当前具身智能面临的核心矛盾是:互联网上有海量人类视频,但缺乏将视觉信息转化为机器人可用动作表征的高效路径。LARYBench 从本体动作和语义动作两个粒度出发,构建了涵盖超过一百万段视频、151 种动作类型、11 种机器人形态的数据集。实验结果表明,通用视觉基础模型(如 DINOv3)在动作泛化和控制精度上全面优于专门为具身智能设计的动作专家模型(如 LAPA),说明有效的动作表征可以从大规模人类视频数据中自然涌现。文章还通过消融实验探讨了构建有效隐式动作表征的关键参数配置。
💡 主要观点
- LARYBench 是首个系统化评估隐式动作表征质量的基准。 该基准从本体动作和语义动作两个粒度出发,覆盖超过一百万段视频、151 种动作类型和 11 种机器人形态,为动作表征提供了解耦的、跨本体的评测标准。
💬 文章金句
- 在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。
- 与其在稀缺的机器人标注数据上从头构建动作空间,不如充分利用互联网规模的人类视频资源——通过隐式动作表征从中提取与本体无关的动作先验。
- 通用视觉基础模型在语义理解与控制精度上整体优于专门的具身 LAM,说明有效的动作表征能够在大规模视觉预训练中自然涌现。
📊 文章信息
AI 初评:88
来源:美团技术团队
作者:作者: 美团LongCat
分类:人工智能
语言:中文
阅读时间:17 分钟
字数:4036
标签: 具身智能, 隐式动作表征, LARYBench, 通用视觉模型, 机器人