中国科学院大学联合腾讯等机构开源 SCOPE,首个支持跨游戏、逐像素动作控制的 FPS 世界模型,实现未见场景零样本泛化。
📝 详细摘要
本文介绍了由中国科学院大学、腾讯、新加坡国立大学等机构联合开源的 SCOPE 模型,这是首个面向第一人称射击(FPS)游戏的交互式世界模型。SCOPE 的核心创新在于提出逐像素空间选择性动作调节机制,将离散事件(开火、换弹)的视觉效果精确约束在武器区域,同时保持环境区域的稳定生成,解决了传统方法中全局动作注入导致的全帧像素扰动问题。该模型基于 5B 参数视频扩散 Transformer 端到端训练,在 CrossFPS 测试集上 8 项指标中取得 7 项最优(JEPA 0.806、FVD 690.3、动作完成率 71.5%),并可零样本迁移至训练中从未出现的游戏风格。文章还介绍了 CrossFPS 数据集,这是首个多游戏 FPS 数据集,包含 69,000 个 5 秒片段,覆盖 7 款游戏,并提供了模型的快速开始指南。
💡 主要观点
- SCOPE 提出逐像素空间选择性动作调节机制,解决 FPS 世界模型中的全局动作扰动问题。 传统方法将动作全局注入所有空间位置,导致一个开火指令扰动全帧像素。SCOPE 通过离散通路和连续通路的分离设计,将离散事件效果约束在武器区域,环境区域保持稳定,显著提升生成质量。
💬 文章金句
- SCOPE 的核心观察是:FPS 动作具有空间选择性——离散事件仅影响武器附近的局部区域(scope 内),而连续控制驱动的场景流动应保持环境稳定(scope 外)。
- SCOPE 在 CrossFPS 测试集上 8 项指标中取得 7 项最优(JEPA 0.806、FVD 690.3、动作完成率 71.5%),并可零样本迁移至训练中从未出现的游戏风格。
- 随着任务复杂度提升,SCOPE 的优势更加明显:多动作组合 75.3% vs 28.7%,环境交互 54% vs 21.3%。
📊 文章信息
AI 初评:85
来源:魔搭ModelScope社区
作者:魔搭ModelScope社区
分类:人工智能
语言:中文
阅读时间:7 分钟
字数:1716
标签: 世界模型, FPS 游戏, 视频生成, 扩散 Transformer, 零样本泛化