清华 AIR 与伯克利 BAIR 联合提出 ODEWorld,首个连续时间具身世界模型,通过 PT-Flow 学习潜空间速度场实现任意帧率生成、时间补全与反向推演,在 LIBERO 基准上以单 Token 极致压缩达成 SOTA 预测质量与 55 倍推理加速。
📝 详细摘要
文章详细介绍了清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 团队最新发布的 ODEWorld——全球首个连续时间具身世界模型。针对传统离散视频世界模型仅能固定帧率预测、难以处理帧间关键动态及缺帧恢复的痛点,ODEWorld 提出 Physical-Time Flow(PT-Flow)范式:不再预测下一帧,而是学习潜状态对物理时间的导数(速度场),再通过 ODE 求解器积分获得连续轨迹。核心技术创新包括:1)静动态解耦,冻结 DINOv2 提取静态特征,仅用 1×768 单 Token 建模动态变化,实现极致压缩;2)引入 JVP(雅可比向量积)直接监督一阶时间导数,有效避免表征坍缩,有效秩显著高于 V-JEPA 2;3)采用 Savitzky-Golay 滤波平滑视觉编码噪声,获得稳定的物理速度监督信号。训练完成后,同一速度场统一支撑任意时间分辨率生成、缺帧时间补全、反向生成三大能力。实验显示,在 LIBERO 64 帧长程预测中,ODEWorld 以 0.072 秒延迟(LDP 的 1/55)同时取得更优 PSNR/LPIPS,验证了连续建模在具身智能中的高效与有效性。文章最后指出,这一工作将世界模型学习目标从「离散映射」转向「连续变化率」,更贴合机器人交互的物理本质。
💡 主要观点
- 提出首个连续时间具身世界模型 ODEWorld,核心范式 PT-Flow 学习潜空间速度场而非离散帧映射。 传统模型绑定固定时间步长,无法处理帧间动态与缺帧。ODEWorld 通过神经 ODE 建模状态对物理时间的导数,利用 RK4 等求解器积分,原生支持任意帧率采样、时间补全与反向生成。
💬 文章金句
- 机器人真正需要理解的,并不是静态世界由哪些像素组成,而是当它接近、接触并移动一个物体时,世界正在怎样变化,以及这种变化接下来会把它带到哪里。
- ODEWorld 最重要的意义,不只是极致压缩带来的性能提示,而是把世界模型的学习对象从「离散状态之间的映射」转向「状态随物理时间的变化率」。
- 只要模型掌握的是一条连续的变化轨迹,就可以在任意时刻读取状态:需要更高帧率时,从轨迹上增加采样点;观测缺失时,查询中间时刻;需要回看变化来源时,则沿轨迹反向求解。
📊 文章信息
AI 初评:84
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:16 分钟
字数:3972
标签: 世界模型, 具身智能, 神经常微分方程, 机器人学, 视频预测