Spatial-TTT 是一款全新的框架,利用测试时训练(TTT)技术,在视频流中实现高效的长时程 3D 空间记忆与理解。
📝 详细摘要
腾讯混元与清华大学合作发布了“Spatial-TTT”,这是一个专为流式视觉空间智能设计的框架。通过利用测试时训练(TTT)技术,该模型能够更新快权重(fast weights)作为紧凑的空间记忆,使其能处理超过 7000 帧的视频,且内存增长呈亚线性,计算成本降低了 40% 以上。它在长时程视频理解基准测试 VSI-Bench 上达到了 SOTA(州际最高水平)结果,并已开源代码、模型和数据。
📊 文章信息
AI 评分:88
来源:Hunyuan(@TXhunyuan)
作者:Tencent HY
分类:人工智能
语言:英文
阅读时间:4 分钟
字数:877
标签: Spatial-TTT, 测试时训练, 计算机视觉, 3D 空间记忆, 视频理解