← 回總覽

DeepSeek 首次有了视觉能力,技术论文却被它连夜删掉了

📅 2026-05-01 10:35 硅星人Pro 人工智能 2 分鐘 1648 字 評分: 86
DeepSeek 多模态 视觉推理 视觉基元 指代鸿沟
📌 一句话摘要 本文深度解读了 DeepSeek 灰度测试中的视觉能力,其核心创新在于提出「使用视觉基元进行思考」的推理框架,通过点、框、路径坐标等空间标记解决多模态模型的「指代鸿沟」问题,但相关技术论文在发布后不久被撤下。 📝 详细摘要 本文围绕 DeepSeek 灰度测试的视觉能力展开深度分析。文章首先介绍了 DeepSeek 视觉模式在真实场景中的表现,如世界知识丰富的图像识别和网页复刻还原能力,并通过迷宫求解实测展示了其严谨的推理过程。核心部分详细解读了 DeepSeek 提出的「使用视觉基元进行思考」框架,该框架旨在解决多模态模型普遍存在的「指代鸿沟」问题——即模型在连续视觉空间

📌 一句话摘要

本文深度解读了 DeepSeek 灰度测试中的视觉能力,其核心创新在于提出「使用视觉基元进行思考」的推理框架,通过点、框、路径坐标等空间标记解决多模态模型的「指代鸿沟」问题,但相关技术论文在发布后不久被撤下。

📝 详细摘要

本文围绕 DeepSeek 灰度测试的视觉能力展开深度分析。文章首先介绍了 DeepSeek 视觉模式在真实场景中的表现,如世界知识丰富的图像识别和网页复刻还原能力,并通过迷宫求解实测展示了其严谨的推理过程。核心部分详细解读了 DeepSeek 提出的「使用视觉基元进行思考」框架,该框架旨在解决多模态模型普遍存在的「指代鸿沟」问题——即模型在连续视觉空间中难以稳定指向讨论对象。具体而言,模型在计数任务中使用边界框进行「定位-验证-统计」,在空间推理任务中先框出关键对象再进行多步关系判断,在拓扑推理任务中使用点坐标进行路径追踪和连通性分析。文章还分析了该方法的优势:减少幻觉、提高可解释性和效率(800×800 图像仅保留约 90 个 KV cache 条目),同时指出了其局限性:受分辨率限制、依赖显式触发、拓扑推理仍具挑战。最后,文章对论文被撤下的原因进行了推测。

💡 主要观点

- DeepSeek 提出「使用视觉基元进行思考」框架,解决多模态模型的指代鸿沟问题。 传统多模态模型依赖自然语言描述进行视觉推理,容易产生指代模糊。DeepSeek 让模型在推理过程中使用点、边界框、路径坐标等视觉基元作为认知锚点,将推理锚定到图像中的具体位置,模拟人类「指向-推理」协同机制。

视觉基元在计数、空间推理和拓扑推理三类任务中各有具体应用。 计数任务使用边界框进行「定位-验证-统计」;空间推理先框出关键对象再进行多步关系判断;拓扑推理使用点坐标进行路径追踪和连通性分析,如迷宫求解中的深度优先搜索。
该方法在减少幻觉、提高可解释性和效率方面有显著优势。 模型需先定位再判断,减少语义猜测导致的幻觉;输出视觉基元使推理过程可验证;通过高效 token 压缩架构,800×800 图像仅保留约 90 个 KV cache 条目即可取得有竞争力的表现。
视觉基元方法仍存在分辨率限制、依赖显式触发和拓扑推理困难三大局限。 细粒度场景下视觉基元可能标不准;当前需通过触发词激活,未能实现自主判断调用;复杂拓扑推理的跨场景泛化能力有限,路径追踪中任何一步出错都可能导致推理偏误。

💬 文章金句

- 通过把点和框作为认知锚点,我们的模型弥合了「指代鸿沟」,模拟了人类在视觉推理中常用的「指向-推理」协同机制。

  • 多模态模型的能力不只是看得更清楚,还要指得更准确。
  • DeepSeek 想走的路线,并不是无限提高分辨率、堆更多图像 token,而是让模型更有效地使用视觉信息。
  • 视觉基元让模型开始能够在图像中定位、比较和追踪。但要真正处理开放世界里的复杂视觉问题,还需要更强的感知能力、更稳定的自主调用机制,以及更好的跨场景泛化能力。

📊 文章信息

AI 初评:86

来源:硅星人Pro

作者:硅星人Pro

分类:人工智能

语言:中文

阅读时间:20 分钟

字数:4982

标签: DeepSeek, 多模态, 视觉推理, 视觉基元, 指代鸿沟

阅读完整文章

查看原文 → 發佈: 2026-05-01 10:35:00 收錄: 2026-05-01 14:00:40

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。