面壁智能在 WAIC 发布并开源了基于视觉 Token 极致压缩技术的 MiniCPM-Robot 系列具身模型,以 1.5B 参数解决了 VLA 模型的长程记忆难题,并在本地部署的跟踪导航上达到开源最优。
📝 详细摘要
文章报道了面壁智能在 2026 年世界人工智能大会上发布并开源的首个具身智能系列模型 MiniCPM-Robot。该系列包含两个模型:负责操作的 MiniCPM-RobotManip 和负责跟踪导航的 MiniCPM-RobotTrack。文章重点解释了 MiniCPM-RobotManip 如何利用面壁在多模态大模型上积累的视觉 Token 极致压缩技术,以较低算力成本将历史观测数据纳入模型,解决了主流 VLA 模型因算力压力而放弃记忆的难题,在考验上下文记忆的 RMBench 榜单上取得 53 分,远超竞品。同时,MiniCPM-RobotTrack 展示了在纯本地、弱网环境下,仅凭 0.9B 参数即可实现高成功率的自然语言指令跟踪能力。文章还介绍了配套的推理引擎 PhyAI 以及与乐聚、吉利汽车的真实场景落地案例。
💡 主要观点
- 视觉 Token 极致压缩是解决具身智能“记忆”难题的关键技术路径。 面壁通过其多模态模型的压缩能力,将历史观测数据纳入模型输入,同时使计算成本与传统单帧模型持平,从而让机器人具备了长程任务所需的上下文记忆。
💬 文章金句
- 真正的通用人工智能,绝不能只停留在虚拟的屏幕和语言对话里。只有当语言层面的认知智能与物理层面的执行智能完美打通,AGI 的终局才会真正到来。
📊 文章信息
AI 初评:84
来源:AI寒武纪
作者:AI寒武纪
分类:人工智能
语言:中文
阅读时间:16 分钟
字数:3906
标签: 具身智能, VLA, 多模态 AI, 开源项目, 机器人