← 回總覽

SCOPE 开源:首个跨游戏 FPS 世界模型,逐像素动作控制零样本泛化未见场景

📅 2026-05-28 19:07 魔搭ModelScope社区 人工智能 2 分鐘 1595 字 評分: 85
世界模型 FPS 游戏 视频生成 扩散 Transformer 零样本泛化
📌 一句话摘要 中国科学院大学联合腾讯等机构开源 SCOPE,首个支持跨游戏、逐像素动作控制的 FPS 世界模型,实现未见场景零样本泛化。 📝 详细摘要 本文介绍了由中国科学院大学、腾讯、新加坡国立大学等机构联合开源的 SCOPE 模型,这是首个面向第一人称射击(FPS)游戏的交互式世界模型。SCOPE 的核心创新在于提出逐像素空间选择性动作调节机制,将离散事件(开火、换弹)的视觉效果精确约束在武器区域,同时保持环境区域的稳定生成,解决了传统方法中全局动作注入导致的全帧像素扰动问题。该模型基于 5B 参数视频扩散 Transformer 端到端训练,在 CrossFPS 测试集上 8 项指

📌 一句话摘要

中国科学院大学联合腾讯等机构开源 SCOPE,首个支持跨游戏、逐像素动作控制的 FPS 世界模型,实现未见场景零样本泛化。

📝 详细摘要

本文介绍了由中国科学院大学、腾讯、新加坡国立大学等机构联合开源的 SCOPE 模型,这是首个面向第一人称射击(FPS)游戏的交互式世界模型。SCOPE 的核心创新在于提出逐像素空间选择性动作调节机制,将离散事件(开火、换弹)的视觉效果精确约束在武器区域,同时保持环境区域的稳定生成,解决了传统方法中全局动作注入导致的全帧像素扰动问题。该模型基于 5B 参数视频扩散 Transformer 端到端训练,在 CrossFPS 测试集上 8 项指标中取得 7 项最优(JEPA 0.806、FVD 690.3、动作完成率 71.5%),并可零样本迁移至训练中从未出现的游戏风格。文章还介绍了 CrossFPS 数据集,这是首个多游戏 FPS 数据集,包含 69,000 个 5 秒片段,覆盖 7 款游戏,并提供了模型的快速开始指南。

💡 主要观点

- SCOPE 提出逐像素空间选择性动作调节机制,解决 FPS 世界模型中的全局动作扰动问题。 传统方法将动作全局注入所有空间位置,导致一个开火指令扰动全帧像素。SCOPE 通过离散通路和连续通路的分离设计,将离散事件效果约束在武器区域,环境区域保持稳定,显著提升生成质量。

SCOPE 在 CrossFPS 测试集上 8 项指标中 7 项最优,并支持零样本泛化至未见游戏风格。 与三个 SOTA 交互式世界模型对比,SCOPE 在 Photometric Smoothness 指标上比次优模型好 3.2 倍,动作完成率达 71.5%。仅凭单帧上下文图像即可零样本泛化至未见过的视觉风格,无需微调。
CrossFPS 是首个多游戏 FPS 数据集,经过动作分布平衡、视觉-动作去偏和动能归一化处理。 数据集包含 69,000 个 5 秒片段,覆盖 7 款游戏,配备逐帧 10 维手柄遥测信号。通过三阶段数据处理,动作熵从 1.85 提升至 2.94 bits,跨游戏增益方差仅 0.034,为 FPS 世界模型研究提供了标准化基准。

💬 文章金句

- SCOPE 的核心观察是:FPS 动作具有空间选择性——离散事件仅影响武器附近的局部区域(scope 内),而连续控制驱动的场景流动应保持环境稳定(scope 外)。

  • SCOPE 在 CrossFPS 测试集上 8 项指标中取得 7 项最优(JEPA 0.806、FVD 690.3、动作完成率 71.5%),并可零样本迁移至训练中从未出现的游戏风格。
  • 随着任务复杂度提升,SCOPE 的优势更加明显:多动作组合 75.3% vs 28.7%,环境交互 54% vs 21.3%。

📊 文章信息

AI 初评:85

来源:魔搭ModelScope社区

作者:魔搭ModelScope社区

分类:人工智能

语言:中文

阅读时间:7 分钟

字数:1716

标签: 世界模型, FPS 游戏, 视频生成, 扩散 Transformer, 零样本泛化

阅读完整文章

查看原文 → 發佈: 2026-05-28 19:07:00 收錄: 2026-05-29 00:00:17

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。