← 回總覽

刚刚,DeepSeek 最新成果,节前发布!

📅 2026-04-30 21:08 Datawhale 人工智能 2 分鐘 1500 字 評分: 88
DeepSeek 多模态 视觉原语 思维链 V4-Flash
📌 一句话摘要 DeepSeek 联合北大清华开源论文《Thinking with Visual Primitives》,提出在思维链中嵌入坐标 token 作为视觉原语,以解决多模态模型在拓扑推理任务上的引用差距问题。 📝 详细摘要 本文报道了 DeepSeek 在五一节前联合北大、清华发布的最新多模态研究成果。文章指出,当前多模态模型在复杂视觉任务(如密集计数、迷宫导航)上的瓶颈并非感知能力不足,而是引用差距——自然语言无法精确锚定视觉实体。DeepSeek 的解决方案是在模型的思维链中插入 bounding box 和 point 坐标 token,让模型一边推理一边「指」出视觉位置

📌 一句话摘要

DeepSeek 联合北大清华开源论文《Thinking with Visual Primitives》,提出在思维链中嵌入坐标 token 作为视觉原语,以解决多模态模型在拓扑推理任务上的引用差距问题。

📝 详细摘要

本文报道了 DeepSeek 在五一节前联合北大、清华发布的最新多模态研究成果。文章指出,当前多模态模型在复杂视觉任务(如密集计数、迷宫导航)上的瓶颈并非感知能力不足,而是引用差距——自然语言无法精确锚定视觉实体。DeepSeek 的解决方案是在模型的思维链中插入 bounding box 和 point 坐标 token,让模型一边推理一边「指」出视觉位置。模型基于 V4-Flash 架构(284B 总参、13B 激活),通过极致 token 压缩(端到端 7056 倍)将视觉 KV cache 占用降至极低水平。训练采用五段式流水线:cold-start 分别训练 box 和 point 专家、GRPO 强化学习、数据混合统一训练、On-Policy Distillation。在 11 个 benchmark 横评中,模型在迷宫导航(66.9 vs GPT-5.4 50.6)和路径追踪(56.7 vs 46.5)上大幅领先,验证了视觉原语在拓扑推理任务上的有效性。

💡 主要观点

- 多模态模型的瓶颈是引用差距而非感知差距。 即使模型能看清所有像素,自然语言在连续视觉空间中也无法精确锚定物体,导致密集计数、多步空间推断等任务逻辑崩塌。

视觉原语将坐标 token 嵌入思维链,实现边推理边定位。 模型在推理过程中插入 bounding box 锚定物体、point 描绘轨迹,使 CoT 具备空间精确性,这是纯语言 CoT 无法做到的。
极致 token 压缩是 DeepSeek 多模态路线的核心工程策略。 通过 ViT 通道压缩、CSA 注意力等多级压缩,端到端压缩比达 7056 倍,将视觉 KV cache 占用降至竞品一个数量级以下。
在拓扑推理任务上大幅领先 GPT-5.4 等前沿模型。 迷宫导航 66.9 vs 50.6、路径追踪 56.7 vs 46.5,验证了视觉原语在需要连续空间推理的任务上的独特优势。

💬 文章金句

- 多模态模型在复杂任务上崩,常常不是「看不见」,是「指不准」。

  • 自然语言天然是模糊的指代工具。
  • 别人卷「看更多像素」,DeepSeek 这次卷的是「看更少像素,但思考时手指点得更准」。
  • 先把「省 token」做到极致,再把省下来的预算塞进更贵的能力。

📊 文章信息

AI 初评:88

来源:Datawhale

作者:Datawhale

分类:人工智能

语言:中文

阅读时间:11 分钟

字数:2665

标签: DeepSeek, 多模态, 视觉原语, 思维链, V4-Flash

阅读完整文章

查看原文 → 發佈: 2026-04-30 21:08:00 收錄: 2026-05-01 04:01:05

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。