DeepSeek 最新论文提出「用视觉原语思考」方法,通过将边界框和坐标点作为思维单元嵌入推理过程,以极低算力成本破解多模态大模型的「指代鸿沟」问题。
📝 详细摘要
本文详细解读了 DeepSeek 最新发表的论文《用视觉原语思考》。文章首先指出当前多模态大模型存在一个核心缺陷——「指代鸿沟」,即模型无法像人类一样在思考时精确「指认」画面中的物体,这是导致计数、空间推理等任务失败的根本原因。DeepSeek 的解决方案是将空间标记(边界框和坐标点)直接作为语言的一部分嵌入到 AI 的思考过程中,定义为「视觉原语」。文章展示了该方法的实战结果:一个仅激活 13B 参数的模型,在计数、空间推理和拓扑推理等基准测试中与 GPT-5.4、Claude-4.6 等顶级模型正面较量,部分项目甚至领先。更关键的是,通过七千倍的极致压缩技术,该模型消耗的算力仅为其它顶级模型的几十分之一。文章还详细披露了训练模式,包括两阶段数据过滤、预训练和后训练(专业化 SFT、专业化 RL、统一 RFT、在线策略蒸馏)的完整流程,并指出了当前方法的局限性。
💡 主要观点
- 多模态大模型存在「指代鸿沟」缺陷,无法精确指认画面物体。 模型用文字描述去执行空间任务,导致计数和空间推理时容易混淆或遗漏对象,这是「看清楚≠想清楚」的根本原因。
💬 文章金句
- 多模态大模型有一个被长期忽视的致命缺陷:它无法像人类一样,在思考时精确地「指认」画面中的物体。
- 看清楚≠想清楚。
- 把空间标记——边界框和坐标点,直接作为语言的一部分,嵌入到 AI 的思考过程中。
- 从原始像素到最终的 KV 缓存,整体压缩比高达 7056 倍。
- 这是一种犀利的方法,将语言扎根于视觉之中。将这些空间标记作为最小的思维单元交织在一起,感觉像是一大进步。
📊 文章信息
AI 初评:87
来源:51CTO技术栈
作者:51CTO技术栈
分类:人工智能
语言:中文
阅读时间:16 分钟
字数:3932
标签: DeepSeek, 多模态, 视觉原语, 指代鸿沟, 空间推理