DeepSeek 联合北大、清华提出视觉基元推理框架,将边界框与坐标点作为最小思考单元,解决多模态大模型的空间推理指代鸿沟问题,性能比肩 GPT-5.4 等前沿模型。
📝 详细摘要
本文报道了 DeepSeek 联合北京大学、清华大学发布的最新多模态技术「Thinking with Visual Primitives」(基于视觉基元的思考)。该技术针对当前多模态大语言模型在空间推理中存在的 Reference Gap(指代鸿沟)问题,提出将边界框和坐标点提升为与语言 token 同级的「最小思考单元」,让模型在推理过程中边指边想。基于 DeepSeek-V4-Flash 构建的模型,在仅使用约 90 个 KV Cache 视觉 token 的情况下,在计数、空间推理、迷宫导航和路径追踪等任务上性能比肩 GPT-5.4、Claude-Sonnet-4.6 与 Gemini-3-Flash。文章详细介绍了架构设计(极致压缩比达 7056:1)、五阶段后训练流程、四大推理场景的冷启动数据构造方法,以及精细化的 Reward Model 设计。实验结果显示,该模型在拓扑推理任务上形成断层式领先,迷宫导航达 66.9%(次高仅 50.6%),路径追踪达 56.7%(次高仅 46.5%)。
💡 主要观点
- 提出视觉基元推理框架,将边界框和坐标点作为最小思考单元。 模型在推理过程中交错插入视觉基元,实现边指边想,解决自然语言描述与精确视觉空间之间的指代鸿沟问题。
💬 文章金句
- 将边界框(bounding boxes)和点(points)提升为与语言 token 同级的「最小思考单元」,直接交错插入模型的推理轨迹中。
- 模型不再是「说完再指」,而是边指边想(point while it reasons)。
- 从原始像素到 KV Cache,整体压缩比高达 7,056:1。
- DS_Maze_Navigation 66.9%(次高仅 50.6%),DS_Path_Tracing 56.7%(次高仅 46.5%),形成断层式领先。
📊 文章信息
AI 初评:87
来源:AINLP
作者:AINLP
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3263
标签: DeepSeek, 多模态, 视觉基元推理, 空间推理, Reference Gap