← 回總覽

全球首个,连续时间具身世界模型!任意帧率自由生成

📅 2026-08-05 19:07 新智元 人工智能 2 分鐘 2159 字 評分: 84
世界模型 具身智能 神经常微分方程 机器人学 视频预测
📌 一句话摘要 清华 AIR 与伯克利 BAIR 联合提出 ODEWorld,首个连续时间具身世界模型,通过 PT-Flow 学习潜空间速度场实现任意帧率生成、时间补全与反向推演,在 LIBERO 基准上以单 Token 极致压缩达成 SOTA 预测质量与 55 倍推理加速。 📝 详细摘要 文章详细介绍了清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 团队最新发布的 ODEWorld——全球首个连续时间具身世界模型。针对传统离散视频世界模型仅能固定帧率预测、难以处理帧间关键动态及缺帧恢复的痛点,ODEWorld 提出 Physical-Time Flow(PT-Flo

📌 一句话摘要

清华 AIR 与伯克利 BAIR 联合提出 ODEWorld,首个连续时间具身世界模型,通过 PT-Flow 学习潜空间速度场实现任意帧率生成、时间补全与反向推演,在 LIBERO 基准上以单 Token 极致压缩达成 SOTA 预测质量与 55 倍推理加速。

📝 详细摘要

文章详细介绍了清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 团队最新发布的 ODEWorld——全球首个连续时间具身世界模型。针对传统离散视频世界模型仅能固定帧率预测、难以处理帧间关键动态及缺帧恢复的痛点,ODEWorld 提出 Physical-Time Flow(PT-Flow)范式:不再预测下一帧,而是学习潜状态对物理时间的导数(速度场),再通过 ODE 求解器积分获得连续轨迹。核心技术创新包括:1)静动态解耦,冻结 DINOv2 提取静态特征,仅用 1×768 单 Token 建模动态变化,实现极致压缩;2)引入 JVP(雅可比向量积)直接监督一阶时间导数,有效避免表征坍缩,有效秩显著高于 V-JEPA 2;3)采用 Savitzky-Golay 滤波平滑视觉编码噪声,获得稳定的物理速度监督信号。训练完成后,同一速度场统一支撑任意时间分辨率生成、缺帧时间补全、反向生成三大能力。实验显示,在 LIBERO 64 帧长程预测中,ODEWorld 以 0.072 秒延迟(LDP 的 1/55)同时取得更优 PSNR/LPIPS,验证了连续建模在具身智能中的高效与有效性。文章最后指出,这一工作将世界模型学习目标从「离散映射」转向「连续变化率」,更贴合机器人交互的物理本质。

💡 主要观点

- 提出首个连续时间具身世界模型 ODEWorld,核心范式 PT-Flow 学习潜空间速度场而非离散帧映射。 传统模型绑定固定时间步长,无法处理帧间动态与缺帧。ODEWorld 通过神经 ODE 建模状态对物理时间的导数,利用 RK4 等求解器积分,原生支持任意帧率采样、时间补全与反向生成。

静动态解耦与单 Token 极致压缩:冻结 DINOv2 编码静态背景,动态编码器仅输出 1×768 Token 建模变化量。 静态信息从参考帧获取,动态 Token 只编码相对变化,将速度场参数化为轻量三层 MLP。这种解耦使有效秩达 425.2(高于 DINOv2 与 V-JEPA 2),避免了背景噪声淹没动态信号。
创新采用 JVP 直接监督一阶时间导数,配合 Savitzky-Golay 滤波消除视觉编码高频抖动。 利用链式法则将像素/特征空间差分投影至动态潜空间作为速度监督目标,强制潜空间保留变化维度防止坍缩;SG 滤波在局部窗口多项式平滑求导,保留接触抓取等关键动态同时抑制 DINOv2 时间不一致噪声。
单一速度场统一三大生成能力,且在 LIBERO 长程预测中实现 SOTA 质量与极致效率(64 帧仅 72ms)。 正向积分支持任意帧率/快进慢放,插值查询实现缺帧恢复,反向积分生成物理合理历史。实验显示 64 帧预测 PSNR 19.46/LPIPS 0.134 优于 LDP 与 V-JEPA 2,推理延迟仅为 LDP 的 1/55,验证了紧凑潜空间+轻量速度场的算力优势。
范式意义:将世界模型学习目标从「预测下一帧」转向「建模变化率」,更贴合具身智能对连续物理交互的理解需求。 机器人操作关键在于接触瞬间的力与位置连续变化,离散帧天然丢失帧间信息。ODEWorld 直接学习连续动力学,使预测从逐帧模仿走向连续动态推演,为具身智能提供更本真的世界理解基座。

💬 文章金句

- 机器人真正需要理解的,并不是静态世界由哪些像素组成,而是当它接近、接触并移动一个物体时,世界正在怎样变化,以及这种变化接下来会把它带到哪里。

  • ODEWorld 最重要的意义,不只是极致压缩带来的性能提示,而是把世界模型的学习对象从「离散状态之间的映射」转向「状态随物理时间的变化率」。
  • 只要模型掌握的是一条连续的变化轨迹,就可以在任意时刻读取状态:需要更高帧率时,从轨迹上增加采样点;观测缺失时,查询中间时刻;需要回看变化来源时,则沿轨迹反向求解。

📊 文章信息

AI 初评:84

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:16 分钟

字数:3972

标签: 世界模型, 具身智能, 神经常微分方程, 机器人学, 视频预测

阅读完整文章

查看原文 → 發佈: 2026-08-05 19:07:00 收錄: 2026-08-06 06:00:56

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。