← 回總覽

入选 ECCV 2026!清华开源空间模型打败 Gemini:真正的空间智能是在世界变化中持续学习

📅 2026-06-22 11:48 思邈 人工智能 2 分鐘 1526 字 評分: 84
空间智能 多模态大模型 测试时训练 长视频理解 ECCV 2026
📌 一句话摘要 清华提出 Spatial-TTT 模型,采用测试时训练(TTT)机制在长视频流中持续更新空间记忆,以 2B 参数量在多项空间智能基准上超越 GPT-5、Gemini-3-pro 等闭源模型,被 ECCV 2026 接收。 📝 详细摘要 文章介绍清华大学等机构入选 ECCV 2026 的工作 Spatial-TTT,旨在解决多模态模型在长视频流中的流式空间理解问题。现有方法依赖固定上下文窗口,难以处理持续变化的视觉输入。Spatial-TTT 采用混合式 TTT 架构(75% TTT 层负责长程记忆写入,25% 全注意力层保持语义能力),引入空间预测机制(3D 时空卷积增强

📌 一句话摘要

清华提出 Spatial-TTT 模型,采用测试时训练(TTT)机制在长视频流中持续更新空间记忆,以 2B 参数量在多项空间智能基准上超越 GPT-5、Gemini-3-pro 等闭源模型,被 ECCV 2026 接收。

📝 详细摘要

文章介绍清华大学等机构入选 ECCV 2026 的工作 Spatial-TTT,旨在解决多模态模型在长视频流中的流式空间理解问题。现有方法依赖固定上下文窗口,难以处理持续变化的视觉输入。Spatial-TTT 采用混合式 TTT 架构(75% TTT 层负责长程记忆写入,25% 全注意力层保持语义能力),引入空间预测机制(3D 时空卷积增强 token 间几何连续性)和稠密场景描述监督(两阶段训练:先学习全局空间记忆,再强化细粒度推理)。在 VSI-Bench、MindCube-Tiny、VSI-SUPER 等基准上,2B 模型超越包括 GPT-5 和 Gemini-3-pro 在内的闭源模型,最长可处理 120 分钟视频,且显存与计算量降低超 40%。文章指出,该工作为物理世界 Agent(机器人、自动驾驶、AR)提供了从流式视觉感知走向持续世界状态建模的路径。

💡 主要观点

- Spatial-TTT 通过测试时训练(TTT)实现长视频流中的持续空间记忆更新。 模型在处理视频帧时在线更新快速权重(fast weights),而非一次性将整段视频塞入上下文,从而避免上下文膨胀,支持长达 120 分钟的视频处理。

混合式架构兼顾长程记忆与语义理解:75% TTT 层 + 25% 标准注意力层。 TTT 层负责将长程空间信息写入快速权重,标准注意力层作为锚定层保留预训练的跨模态语义能力,两者协同实现记忆与理解的平衡。
空间预测机制与稠密监督信号是关键性能增量。 在 TTT 分支加入 3D 时空卷积捕捉局部几何连续性,配合稠密场景描述监督让模型学习维护全局 3D 记忆。消融实验显示,去掉二者分别导致 VSI-Bench 分数下降 2.3 和 3.1 分。
2B 参数模型超越 GPT-5、Gemini-3-pro,效率优势显著。 在 VSI-Bench 上得分为 64.4,MindCube-Tiny 准确率 76.2%(超出 Gemini-3-pro 12 个百分点)。1024 帧输入下显存与计算量分别比大厂模型降低超 40%。

💬 文章金句

- 让模型不只是看视频,而是在观看过程中,边看、边更新、边「长出」一份空间记忆。

  • Spatial-TTT 不是用 TTT 取代注意力,而是让两者各自承担不同角色:TTT 负责记得更久,全注意力负责理解得更准。

📊 文章信息

AI 初评:84

来源:量子位

作者:思邈

分类:人工智能

语言:中文

阅读时间:18 分钟

字数:4310

标签: 空间智能, 多模态大模型, 测试时训练, 长视频理解, ECCV 2026

阅读完整文章

查看原文 → 發佈: 2026-06-22 11:48:38 收錄: 2026-06-22 16:00:39

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。