← 回總覽

DeepSeek 发布多模态论文《Thinking with Visual Primitives》

📅 2026-04-30 20:09 歸藏(guizang.ai) 人工智能 1 分鐘 789 字 評分: 82
DeepSeek 多模态 视觉原语 Thinking with Visual Primitives MoE
📌 一句话摘要 DeepSeek 公开多模态大语言模型论文,基于 DeepSeek-V4-Flash,引入视觉原语推理,在极低 Token 成本下对齐甚至反超 GPT-5.4、Claude 和 Gemini。 📝 详细摘要 DeepSeek 公开了其多模态大语言模型论文《Thinking with Visual Primitives》。该模型基于 DeepSeek-V4-Flash,采用 MoE 架构,总参数量 284B,激活参数量 13B。模型使用自研的 DeepSeek-ViT 视觉编码模型,采用 14×14 patch 和 3×3 空间压缩后接入 LLM。其核心创新在于模型不仅进行文

📌 一句话摘要

DeepSeek 公开多模态大语言模型论文,基于 DeepSeek-V4-Flash,引入视觉原语推理,在极低 Token 成本下对齐甚至反超 GPT-5.4、Claude 和 Gemini。

📝 详细摘要

DeepSeek 公开了其多模态大语言模型论文《Thinking with Visual Primitives》。该模型基于 DeepSeek-V4-Flash,采用 MoE 架构,总参数量 284B,激活参数量 13B。模型使用自研的 DeepSeek-ViT 视觉编码模型,采用 14×14 patch 和 3×3 空间压缩后接入 LLM。其核心创新在于模型不仅进行文字推理,还会通过画框、打点等视觉原语进行思考。在极低的 Token 成本下,该模型在多个前沿指标上与 GPT-5.4、Claude 和 Gemini 对齐甚至反超,展示了 DeepSeek 在多模态领域的技术突破。

📊 文章信息

AI 初评:82

来源:歸藏(guizang.ai)(@op7418)

作者:歸藏(guizang.ai)

分类:人工智能

语言:中文

阅读时间:2 分钟

字数:274

标签: DeepSeek, 多模态, 视觉原语, Thinking with Visual Primitives, MoE

阅读推文

查看原文 → 發佈: 2026-04-30 20:09:38 收錄: 2026-05-01 00:00:59

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。