← 回總覽

从月球漫步到赛博都市,WBench 测出了世界模型的边界

📅 2026-06-15 19:02 美团 · 技术团队 人工智能 2 分鐘 1653 字 評分: 89
世界模型 AI 评测 交互式视频 多轮评测 AI 视频生成
📌 一句话摘要 美团 LongCat 团队提出 WBench,首个面向交互式视频世界模型的系统性多轮评测基准,通过 289 个测试案例对 20 个前沿模型进行扫描,揭示了导航能力与画质脱钩、多轮交互衰减等核心瓶颈。 📝 详细摘要 本文由美团 LongCat 团队撰写,正式发布了 WBench——首个面向交互式视频世界模型的系统性多轮评测基准。文章首先阐述了评测框架的核心设计理念:世界定义、指令集、统一交互接口与评测套件。WBench 包含 289 个测试案例和 1058 个交互轮次,覆盖导航、主体动作、事件编辑和视角切换四种交互方式,支持第一/第三人称视角,并设计了视频质量、设定遵循度、交

📌 一句话摘要

美团 LongCat 团队提出 WBench,首个面向交互式视频世界模型的系统性多轮评测基准,通过 289 个测试案例对 20 个前沿模型进行扫描,揭示了导航能力与画质脱钩、多轮交互衰减等核心瓶颈。

📝 详细摘要

本文由美团 LongCat 团队撰写,正式发布了 WBench——首个面向交互式视频世界模型的系统性多轮评测基准。文章首先阐述了评测框架的核心设计理念:世界定义、指令集、统一交互接口与评测套件。WBench 包含 289 个测试案例和 1058 个交互轮次,覆盖导航、主体动作、事件编辑和视角切换四种交互方式,支持第一/第三人称视角,并设计了视频质量、设定遵循度、交互遵循度、一致性和物理真实性五个评测维度。团队对 Kling 3.0、HY-World 1.5、Genie 3 等 20 个前沿模型进行了全面评测,得出四个关键洞察:不存在全能模型、导航能力与其他维度脱钩、多轮交互中导航能力雪崩式下降(平均分下降 33 点)、开源模型在某些能力上超越闭源。文章还分析了不同世界设定(视角、主体类型)带来的结构性难度差异。WBench 的自动评分与 400 名人类标注者的偏好高度一致(Spearman ρ ≥ 0.94),验证了其可靠性。最后,文章指出 WBench 代表了从「被动生成」到「主动交互」的范式转移,并已开源全部代码与数据。

💡 主要观点

- WBench 是首个面向交互式视频世界模型的系统性多轮评测基准。 它通过世界定义、指令集、统一交互接口和评测套件四大要素,实现了对文本驱动模型和专用世界模型的统一、公平评测,覆盖导航、主体动作、事件编辑和视角切换四种交互方式。

导航能力与视频画质等维度基本脱钩。 相关性矩阵显示,导航与其他维度的相关系数接近于零,说明模型「知道」世界长什么样,但并未「理解」自身在世界中的位置和方向,导航依赖于独立的「空间状态表示」能力。
多轮交互是当前世界模型的核心难点。 所有模型在连续交互后表现均下降,导航能力尤为严重,从第一轮到第四轮及以后平均分下降 33 点,位姿误差逐轮累积是迭代式生成范式的结构性缺陷。
不同世界设定带来结构性难度差异。 第一人称视角让导航更容易但场景设定更难保持,动物主体因其复杂的动态性对模型挑战最大,说明评测需要覆盖多样化的世界设定。
WBench 自动评分与人类偏好高度对齐。 与 400 名人类标注者的偏好判断 Spearman ρ ≥ 0.94,验证了评测基准的准确性和可靠性,为后续研究提供了可信的标尺。

💬 文章金句

- 不存在全能模型:不同模型各有专长,文本驱动模型更擅长理解场景,而专用世界模型在交互控制上突出。

  • 模型的视频画质好坏,和它的导航控制能力基本没关系。
  • 所有模型在连续交互后表现都会变差,导航能力尤其严重,平均分下降了整整 33 点。
  • WBench 不仅是一个评测工具,更代表了研究范式的一次重要演进。

📊 文章信息

AI 初评:89

来源:美团 · 技术团队

作者:美团 · 技术团队

分类:人工智能

语言:中文

阅读时间:9 分钟

字数:2226

标签: 世界模型, AI 评测, 交互式视频, 多轮评测, AI 视频生成

阅读完整文章

查看原文 → 發佈: 2026-06-15 19:02:06 收錄: 2026-06-15 20:00:31

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。