← 回總覽

DeepSeek 多模态技术报告曝光!细节拉满:七千倍极致压缩,用视觉原语思考,破解指代鸿沟!

📅 2026-05-01 08:18 51CTO技术栈 人工智能 2 分鐘 1471 字 評分: 87
DeepSeek 多模态 视觉原语 指代鸿沟 空间推理
📌 一句话摘要 DeepSeek 最新论文提出「用视觉原语思考」方法,通过将边界框和坐标点作为思维单元嵌入推理过程,以极低算力成本破解多模态大模型的「指代鸿沟」问题。 📝 详细摘要 本文详细解读了 DeepSeek 最新发表的论文《用视觉原语思考》。文章首先指出当前多模态大模型存在一个核心缺陷——「指代鸿沟」,即模型无法像人类一样在思考时精确「指认」画面中的物体,这是导致计数、空间推理等任务失败的根本原因。DeepSeek 的解决方案是将空间标记(边界框和坐标点)直接作为语言的一部分嵌入到 AI 的思考过程中,定义为「视觉原语」。文章展示了该方法的实战结果:一个仅激活 13B 参数的模型,

📌 一句话摘要

DeepSeek 最新论文提出「用视觉原语思考」方法,通过将边界框和坐标点作为思维单元嵌入推理过程,以极低算力成本破解多模态大模型的「指代鸿沟」问题。

📝 详细摘要

本文详细解读了 DeepSeek 最新发表的论文《用视觉原语思考》。文章首先指出当前多模态大模型存在一个核心缺陷——「指代鸿沟」,即模型无法像人类一样在思考时精确「指认」画面中的物体,这是导致计数、空间推理等任务失败的根本原因。DeepSeek 的解决方案是将空间标记(边界框和坐标点)直接作为语言的一部分嵌入到 AI 的思考过程中,定义为「视觉原语」。文章展示了该方法的实战结果:一个仅激活 13B 参数的模型,在计数、空间推理和拓扑推理等基准测试中与 GPT-5.4、Claude-4.6 等顶级模型正面较量,部分项目甚至领先。更关键的是,通过七千倍的极致压缩技术,该模型消耗的算力仅为其它顶级模型的几十分之一。文章还详细披露了训练模式,包括两阶段数据过滤、预训练和后训练(专业化 SFT、专业化 RL、统一 RFT、在线策略蒸馏)的完整流程,并指出了当前方法的局限性。

💡 主要观点

- 多模态大模型存在「指代鸿沟」缺陷,无法精确指认画面物体。 模型用文字描述去执行空间任务,导致计数和空间推理时容易混淆或遗漏对象,这是「看清楚≠想清楚」的根本原因。

DeepSeek 提出「用视觉原语思考」方法,将边界框和坐标点嵌入推理过程。 边界框用于固定物体边界,适合计数和空间推理;坐标点用于抽象空间引用,适合路径追踪和迷宫导航。
该模型以极低算力实现顶级性能,压缩比高达七千倍。 一张 756×756 图像仅占用 81 个 KV 缓存条目,通过视觉编码器压缩和稀疏注意力机制实现极致压缩,算力消耗仅为其它模型的几十分之一。
后训练采用四步流水线:专业化 SFT、专业化 RL、统一 RFT 和在线策略蒸馏。 先分别训练框和点两个专家模型,再用强化学习强化,然后统一训练一个「框点通吃」的模型,最后通过蒸馏让统一模型向两个专家学习。

💬 文章金句

- 多模态大模型有一个被长期忽视的致命缺陷:它无法像人类一样,在思考时精确地「指认」画面中的物体。

  • 看清楚≠想清楚。
  • 把空间标记——边界框和坐标点,直接作为语言的一部分,嵌入到 AI 的思考过程中。
  • 从原始像素到最终的 KV 缓存,整体压缩比高达 7056 倍。
  • 这是一种犀利的方法,将语言扎根于视觉之中。将这些空间标记作为最小的思维单元交织在一起,感觉像是一大进步。

📊 文章信息

AI 初评:87

来源:51CTO技术栈

作者:51CTO技术栈

分类:人工智能

语言:中文

阅读时间:16 分钟

字数:3932

标签: DeepSeek, 多模态, 视觉原语, 指代鸿沟, 空间推理

阅读完整文章

查看原文 → 發佈: 2026-05-01 08:18:00 收錄: 2026-05-01 20:00:33

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。