本文深度解读了 DeepSeek 灰度测试中的视觉能力,其核心创新在于提出「使用视觉基元进行思考」的推理框架,通过点、框、路径坐标等空间标记解决多模态模型的「指代鸿沟」问题,但相关技术论文在发布后不久被撤下。
📝 详细摘要
本文围绕 DeepSeek 灰度测试的视觉能力展开深度分析。文章首先介绍了 DeepSeek 视觉模式在真实场景中的表现,如世界知识丰富的图像识别和网页复刻还原能力,并通过迷宫求解实测展示了其严谨的推理过程。核心部分详细解读了 DeepSeek 提出的「使用视觉基元进行思考」框架,该框架旨在解决多模态模型普遍存在的「指代鸿沟」问题——即模型在连续视觉空间中难以稳定指向讨论对象。具体而言,模型在计数任务中使用边界框进行「定位-验证-统计」,在空间推理任务中先框出关键对象再进行多步关系判断,在拓扑推理任务中使用点坐标进行路径追踪和连通性分析。文章还分析了该方法的优势:减少幻觉、提高可解释性和效率(800×800 图像仅保留约 90 个 KV cache 条目),同时指出了其局限性:受分辨率限制、依赖显式触发、拓扑推理仍具挑战。最后,文章对论文被撤下的原因进行了推测。
💡 主要观点
- DeepSeek 提出「使用视觉基元进行思考」框架,解决多模态模型的指代鸿沟问题。 传统多模态模型依赖自然语言描述进行视觉推理,容易产生指代模糊。DeepSeek 让模型在推理过程中使用点、边界框、路径坐标等视觉基元作为认知锚点,将推理锚定到图像中的具体位置,模拟人类「指向-推理」协同机制。
💬 文章金句
- 通过把点和框作为认知锚点,我们的模型弥合了「指代鸿沟」,模拟了人类在视觉推理中常用的「指向-推理」协同机制。
- 多模态模型的能力不只是看得更清楚,还要指得更准确。
- DeepSeek 想走的路线,并不是无限提高分辨率、堆更多图像 token,而是让模型更有效地使用视觉信息。
- 视觉基元让模型开始能够在图像中定位、比较和追踪。但要真正处理开放世界里的复杂视觉问题,还需要更强的感知能力、更稳定的自主调用机制,以及更好的跨场景泛化能力。
📊 文章信息
AI 初评:86
来源:硅星人Pro
作者:硅星人Pro
分类:人工智能
语言:中文
阅读时间:20 分钟
字数:4982
标签: DeepSeek, 多模态, 视觉推理, 视觉基元, 指代鸿沟