美团 LongCat 团队提出 WBench,首个面向交互式视频世界模型的系统性多轮评测基准,通过 289 个测试案例对 20 个前沿模型进行扫描,揭示了导航能力与画质脱钩、多轮交互衰减等核心瓶颈。
📝 详细摘要
本文由美团 LongCat 团队撰写,正式发布了 WBench——首个面向交互式视频世界模型的系统性多轮评测基准。文章首先阐述了评测框架的核心设计理念:世界定义、指令集、统一交互接口与评测套件。WBench 包含 289 个测试案例和 1058 个交互轮次,覆盖导航、主体动作、事件编辑和视角切换四种交互方式,支持第一/第三人称视角,并设计了视频质量、设定遵循度、交互遵循度、一致性和物理真实性五个评测维度。团队对 Kling 3.0、HY-World 1.5、Genie 3 等 20 个前沿模型进行了全面评测,得出四个关键洞察:不存在全能模型、导航能力与其他维度脱钩、多轮交互中导航能力雪崩式下降(平均分下降 33 点)、开源模型在某些能力上超越闭源。文章还分析了不同世界设定(视角、主体类型)带来的结构性难度差异。WBench 的自动评分与 400 名人类标注者的偏好高度一致(Spearman ρ ≥ 0.94),验证了其可靠性。最后,文章指出 WBench 代表了从「被动生成」到「主动交互」的范式转移,并已开源全部代码与数据。
💡 主要观点
- WBench 是首个面向交互式视频世界模型的系统性多轮评测基准。 它通过世界定义、指令集、统一交互接口和评测套件四大要素,实现了对文本驱动模型和专用世界模型的统一、公平评测,覆盖导航、主体动作、事件编辑和视角切换四种交互方式。
💬 文章金句
- 不存在全能模型:不同模型各有专长,文本驱动模型更擅长理解场景,而专用世界模型在交互控制上突出。
- 模型的视频画质好坏,和它的导航控制能力基本没关系。
- 所有模型在连续交互后表现都会变差,导航能力尤其严重,平均分下降了整整 33 点。
- WBench 不仅是一个评测工具,更代表了研究范式的一次重要演进。
📊 文章信息
AI 初评:89
来源:美团 · 技术团队
作者:美团 · 技术团队
分类:人工智能
语言:中文
阅读时间:9 分钟
字数:2226
标签: 世界模型, AI 评测, 交互式视频, 多轮评测, AI 视频生成