港科大(广州)团队提出 FreeOcc,首个无需训练的开放词汇 3D 占据地图构建系统,结合 SLAM、3DGS 与视觉语言模型,在无需标注和真实位姿的情况下实现跨场景零样本泛化。
📝 详细摘要
本文介绍了香港科技大学(广州)陈昶昊教授团队联合 MBZUAI 研究者提出的 FreeOcc 系统,已被机器人顶会 RSS 2026 接收。FreeOcc 是首个无需训练(training-free)的开放词汇三维占据预测系统,仅基于单目或 RGB-D 图像序列,在线构建全局一致的开放词汇三维占据地图。系统将在线开放词汇占据预测拆解为四层模块化地图表示:点云地图(SLAM 提供全局一致几何锚点)、3DGS 地图(几何感知初始化与锚定更新)、语义地图(预训练视觉语言模型提取开放词汇特征)、占据地图(概率式高斯至占据投影)。在 EmbodiedOcc-ScanNet 数据集上,FreeOcc 无需任务特定训练,单目版本达到 31.29 IoU / 13.86 mIoU,RGB-D 版本达到 34.40 IoU / 15.84 mIoU,相较现有自监督方法在 IoU 与 mIoU 指标上均实现超过两倍提升。在跨数据集泛化基准 ReplicaOcc 上,FreeOcc 的 RGB-D 版本取得了 55.65 IoU / 20.90 mIoU 的性能,而现有监督与自监督方法几乎无法实现零样本泛化。系统还支持任意自然语言查询,并在真实机器人上完成部署验证。
💡 主要观点
- FreeOcc 是首个无需训练的开放词汇三维占据预测系统。 系统不依赖任何三维占据标注、语义标注或真实相机位姿,仅基于单目或 RGB-D 图像序列在线构建全局一致的开放词汇三维占据地图,从根本上解决了标注成本高和泛化能力差的问题。
💬 文章金句
- FreeOcc 是首个无需训练(training-free)的开放词汇三维占据预测系统,仅基于单目或 RGB-D 图像序列,在线构建全局一致的开放词汇三维占据地图。
- FreeOcc 不依赖大规模三维占据标注,也不要求推理阶段输入真实相机位姿,而是有效结合 SLAM 几何与位姿、连续三维高斯表示、开放词汇视觉语言模型以及体素占据投影。
- FreeOcc 的开放词汇占据地图不仅让机器人看见环境几何结构,更进一步支持机器人理解环境。
- 当机器人进入一个全新房间时,不再需要重新训练或调整占据预测模型权重,而是直接依靠自身传感器,在线增量构建三维占据地图。
📊 文章信息
AI 初评:88
来源:机器之心
作者:机器之心
分类:人工智能
语言:中文
阅读时间:26 分钟
字数:6426
标签: FreeOcc, 开放词汇占据预测, 3DGS, SLAM, 具身智能