本文解读了 DeepSeek 联合北大、清华发布的多模态技术报告,核心思想是让模型在推理过程中通过「视觉基元」(点和框)精确指代图像对象,以解决复杂视觉推理中的「指代鸿沟」问题。
📝 详细摘要
文章对 DeepSeek 联合北大、清华发布的多模态技术报告进行了要点解读。报告指出,当前多模态大模型在复杂视觉推理中失败的主要原因并非「看不清」(感知鸿沟),而是「指不准」(指代鸿沟),即模型在语言推理过程中容易丢失对图像中对象、位置和路径的精确参照。为此,论文提出了「Thinking with Visual Primitives」方法,将点和框作为视觉推理的基本单元,让模型在思考过程中一边推理、一边框选和标记,类似于人类数数时用手指点、走迷宫时用笔描路线。该方法主要应用于计数、空间推理、迷宫导航和路径追踪四类任务。模型基于 DeepSeek-V4-Flash,总参数 284B,推理激活 13B,通过视觉 token 压缩和 Compressed Sparse Attention 提升效率。实验结果显示,该模型在迷宫导航和路径追踪等任务上明显优于 GPT、Claude、Gemini 等前沿模型。文章最后提供了获取完整技术报告的方式。
💡 主要观点
- 多模态模型复杂推理失败的核心是「指代鸿沟」而非「感知鸿沟」。 模型并非看不清图像细节,而是在语言推理过程中无法精确指向和引用图像中的对象、位置和路径,导致在计数、空间关系等任务中出错。
💬 文章金句
- 这篇论文的价值不在于让模型「看得更多」,而在于让模型「指得更准」。
- 多模态推理的下一步,不只是增加视觉 token,而是让语言推理真正落回图像坐标系。
- 关键不是让模型最后输出点和框,而是让它在思考过程中一边推理、一边框选、一边标记。
📊 文章信息
AI 初评:82
来源:AINLP
作者:AINLP
分类:人工智能
语言:中文
阅读时间:6 分钟
字数:1342
标签: DeepSeek, 多模态, 视觉推理, 指代鸿沟, 视觉基元