← 回總覽

LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征

📅 2026-04-27 08:00 作者: 美团LongCat 人工智能 2 分鐘 1263 字 評分: 88
具身智能 隐式动作表征 LARYBench 通用视觉模型 机器人
📌 一句话摘要 美团技术团队提出 LARYBench,首个系统化评估隐式动作表征质量的基准,实验发现通用视觉模型在动作泛化上显著优于具身专项模型。 📝 详细摘要 本文由美团技术团队发布,介绍了他们提出的 LARYBench(Latent Action Representation Yielding Benchmark),这是一个用于系统化评估隐式动作表征质量的基准。文章指出,当前具身智能面临的核心矛盾是:互联网上有海量人类视频,但缺乏将视觉信息转化为机器人可用动作表征的高效路径。LARYBench 从本体动作和语义动作两个粒度出发,构建了涵盖超过一百万段视频、151 种动作类型、11 种机

📌 一句话摘要

美团技术团队提出 LARYBench,首个系统化评估隐式动作表征质量的基准,实验发现通用视觉模型在动作泛化上显著优于具身专项模型。

📝 详细摘要

本文由美团技术团队发布,介绍了他们提出的 LARYBench(Latent Action Representation Yielding Benchmark),这是一个用于系统化评估隐式动作表征质量的基准。文章指出,当前具身智能面临的核心矛盾是:互联网上有海量人类视频,但缺乏将视觉信息转化为机器人可用动作表征的高效路径。LARYBench 从本体动作和语义动作两个粒度出发,构建了涵盖超过一百万段视频、151 种动作类型、11 种机器人形态的数据集。实验结果表明,通用视觉基础模型(如 DINOv3)在动作泛化和控制精度上全面优于专门为具身智能设计的动作专家模型(如 LAPA),说明有效的动作表征可以从大规模人类视频数据中自然涌现。文章还通过消融实验探讨了构建有效隐式动作表征的关键参数配置。

💡 主要观点

- LARYBench 是首个系统化评估隐式动作表征质量的基准。 该基准从本体动作和语义动作两个粒度出发,覆盖超过一百万段视频、151 种动作类型和 11 种机器人形态,为动作表征提供了解耦的、跨本体的评测标准。

通用视觉模型在动作泛化上显著优于具身专项模型。 实验表明,DINOv3 等通用视觉基础模型在动作回归精度和语义分类准确率上全面领先 LAPA 等具身专项模型,说明有效的动作表征可以从大规模视觉预训练中自然涌现。
人类视频数据在动作表征学习中具有规模化价值。 通用视觉编码器无需显式动作监督,即可从海量人类视频中习得跨形态、跨场景的动作语义,为突破具身智能的数据瓶颈提供了可行路径。

💬 文章金句

- 在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。

  • 与其在稀缺的机器人标注数据上从头构建动作空间,不如充分利用互联网规模的人类视频资源——通过隐式动作表征从中提取与本体无关的动作先验。
  • 通用视觉基础模型在语义理解与控制精度上整体优于专门的具身 LAM,说明有效的动作表征能够在大规模视觉预训练中自然涌现。

📊 文章信息

AI 初评:88

来源:美团技术团队

作者:作者: 美团LongCat

分类:人工智能

语言:中文

阅读时间:17 分钟

字数:4036

标签: 具身智能, 隐式动作表征, LARYBench, 通用视觉模型, 机器人

阅读完整文章

查看原文 → 發佈: 2026-04-27 08:00:00 收錄: 2026-04-27 12:00:49

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。