清华提出 Spatial-TTT 模型,采用测试时训练(TTT)机制在长视频流中持续更新空间记忆,以 2B 参数量在多项空间智能基准上超越 GPT-5、Gemini-3-pro 等闭源模型,被 ECCV 2026 接收。
📝 详细摘要
文章介绍清华大学等机构入选 ECCV 2026 的工作 Spatial-TTT,旨在解决多模态模型在长视频流中的流式空间理解问题。现有方法依赖固定上下文窗口,难以处理持续变化的视觉输入。Spatial-TTT 采用混合式 TTT 架构(75% TTT 层负责长程记忆写入,25% 全注意力层保持语义能力),引入空间预测机制(3D 时空卷积增强 token 间几何连续性)和稠密场景描述监督(两阶段训练:先学习全局空间记忆,再强化细粒度推理)。在 VSI-Bench、MindCube-Tiny、VSI-SUPER 等基准上,2B 模型超越包括 GPT-5 和 Gemini-3-pro 在内的闭源模型,最长可处理 120 分钟视频,且显存与计算量降低超 40%。文章指出,该工作为物理世界 Agent(机器人、自动驾驶、AR)提供了从流式视觉感知走向持续世界状态建模的路径。
💡 主要观点
- Spatial-TTT 通过测试时训练(TTT)实现长视频流中的持续空间记忆更新。 模型在处理视频帧时在线更新快速权重(fast weights),而非一次性将整段视频塞入上下文,从而避免上下文膨胀,支持长达 120 分钟的视频处理。
💬 文章金句
- 让模型不只是看视频,而是在观看过程中,边看、边更新、边「长出」一份空间记忆。
- Spatial-TTT 不是用 TTT 取代注意力,而是让两者各自承担不同角色:TTT 负责记得更久,全注意力负责理解得更准。
📊 文章信息
AI 初评:84
来源:量子位
作者:思邈
分类:人工智能
语言:中文
阅读时间:18 分钟
字数:4310
标签: 空间智能, 多模态大模型, 测试时训练, 长视频理解, ECCV 2026