← 回總覽

刚刚,DeepSeek 开源全新多模态技术!!

📅 2026-05-01 20:14 AINLP 人工智能 2 分鐘 1616 字 評分: 87
DeepSeek 多模态 视觉基元推理 空间推理 Reference Gap
📌 一句话摘要 DeepSeek 联合北大、清华提出视觉基元推理框架,将边界框与坐标点作为最小思考单元,解决多模态大模型的空间推理指代鸿沟问题,性能比肩 GPT-5.4 等前沿模型。 📝 详细摘要 本文报道了 DeepSeek 联合北京大学、清华大学发布的最新多模态技术「Thinking with Visual Primitives」(基于视觉基元的思考)。该技术针对当前多模态大语言模型在空间推理中存在的 Reference Gap(指代鸿沟)问题,提出将边界框和坐标点提升为与语言 token 同级的「最小思考单元」,让模型在推理过程中边指边想。基于 DeepSeek-V4-Flash 构

📌 一句话摘要

DeepSeek 联合北大、清华提出视觉基元推理框架,将边界框与坐标点作为最小思考单元,解决多模态大模型的空间推理指代鸿沟问题,性能比肩 GPT-5.4 等前沿模型。

📝 详细摘要

本文报道了 DeepSeek 联合北京大学、清华大学发布的最新多模态技术「Thinking with Visual Primitives」(基于视觉基元的思考)。该技术针对当前多模态大语言模型在空间推理中存在的 Reference Gap(指代鸿沟)问题,提出将边界框和坐标点提升为与语言 token 同级的「最小思考单元」,让模型在推理过程中边指边想。基于 DeepSeek-V4-Flash 构建的模型,在仅使用约 90 个 KV Cache 视觉 token 的情况下,在计数、空间推理、迷宫导航和路径追踪等任务上性能比肩 GPT-5.4、Claude-Sonnet-4.6 与 Gemini-3-Flash。文章详细介绍了架构设计(极致压缩比达 7056:1)、五阶段后训练流程、四大推理场景的冷启动数据构造方法,以及精细化的 Reward Model 设计。实验结果显示,该模型在拓扑推理任务上形成断层式领先,迷宫导航达 66.9%(次高仅 50.6%),路径追踪达 56.7%(次高仅 46.5%)。

💡 主要观点

- 提出视觉基元推理框架,将边界框和坐标点作为最小思考单元。 模型在推理过程中交错插入视觉基元,实现边指边想,解决自然语言描述与精确视觉空间之间的指代鸿沟问题。

极致 KV Cache 压缩,仅用约 90 个视觉 token 即可比肩前沿模型。 通过 14×14 Patch Embedding、3×3 空间压缩和 Compressed Sparse Attention,实现从原始像素到 KV Cache 高达 7056:1 的压缩比。
在拓扑推理任务上形成断层式领先。 迷宫导航达 66.9%(次高仅 50.6%),路径追踪达 56.7%(次高仅 46.5%),显著超越 GPT-5.4、Claude-Sonnet-4.6 等模型。
五阶段后训练流程实现专家能力融合。 先分别对 Box 和 Point 专家进行独立微调和强化学习,再通过拒绝采样和知识蒸馏统一融合,避免模态冲突。

💬 文章金句

- 将边界框(bounding boxes)和点(points)提升为与语言 token 同级的「最小思考单元」,直接交错插入模型的推理轨迹中。

  • 模型不再是「说完再指」,而是边指边想(point while it reasons)。
  • 从原始像素到 KV Cache,整体压缩比高达 7,056:1。
  • DS_Maze_Navigation 66.9%(次高仅 50.6%),DS_Path_Tracing 56.7%(次高仅 46.5%),形成断层式领先。

📊 文章信息

AI 初评:87

来源:AINLP

作者:AINLP

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3263

标签: DeepSeek, 多模态, 视觉基元推理, 空间推理, Reference Gap

阅读完整文章

查看原文 → 發佈: 2026-05-01 20:14:00 收錄: 2026-05-01 22:00:30

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。