DeepSeek 联合北大清华开源论文《Thinking with Visual Primitives》,提出在思维链中嵌入坐标 token 作为视觉原语,以解决多模态模型在拓扑推理任务上的引用差距问题。
📝 详细摘要
本文报道了 DeepSeek 在五一节前联合北大、清华发布的最新多模态研究成果。文章指出,当前多模态模型在复杂视觉任务(如密集计数、迷宫导航)上的瓶颈并非感知能力不足,而是引用差距——自然语言无法精确锚定视觉实体。DeepSeek 的解决方案是在模型的思维链中插入 bounding box 和 point 坐标 token,让模型一边推理一边「指」出视觉位置。模型基于 V4-Flash 架构(284B 总参、13B 激活),通过极致 token 压缩(端到端 7056 倍)将视觉 KV cache 占用降至极低水平。训练采用五段式流水线:cold-start 分别训练 box 和 point 专家、GRPO 强化学习、数据混合统一训练、On-Policy Distillation。在 11 个 benchmark 横评中,模型在迷宫导航(66.9 vs GPT-5.4 50.6)和路径追踪(56.7 vs 46.5)上大幅领先,验证了视觉原语在拓扑推理任务上的有效性。
💡 主要观点
- 多模态模型的瓶颈是引用差距而非感知差距。 即使模型能看清所有像素,自然语言在连续视觉空间中也无法精确锚定物体,导致密集计数、多步空间推断等任务逻辑崩塌。
💬 文章金句
- 多模态模型在复杂任务上崩,常常不是「看不见」,是「指不准」。
- 自然语言天然是模糊的指代工具。
- 别人卷「看更多像素」,DeepSeek 这次卷的是「看更少像素,但思考时手指点得更准」。
- 先把「省 token」做到极致,再把省下来的预算塞进更贵的能力。
📊 文章信息
AI 初评:88
来源:Datawhale
作者:Datawhale
分类:人工智能
语言:中文
阅读时间:11 分钟
字数:2665
标签: DeepSeek, 多模态, 视觉原语, 思维链, V4-Flash