DeepSeek 公开多模态大语言模型论文,基于 DeepSeek-V4-Flash,引入视觉原语推理,在极低 Token 成本下对齐甚至反超 GPT-5.4、Claude 和 Gemini。
📝 详细摘要
DeepSeek 公开了其多模态大语言模型论文《Thinking with Visual Primitives》。该模型基于 DeepSeek-V4-Flash,采用 MoE 架构,总参数量 284B,激活参数量 13B。模型使用自研的 DeepSeek-ViT 视觉编码模型,采用 14×14 patch 和 3×3 空间压缩后接入 LLM。其核心创新在于模型不仅进行文字推理,还会通过画框、打点等视觉原语进行思考。在极低的 Token 成本下,该模型在多个前沿指标上与 GPT-5.4、Claude 和 Gemini 对齐甚至反超,展示了 DeepSeek 在多模态领域的技术突破。
📊 文章信息
AI 初评:82
来源:歸藏(guizang.ai)(@op7418)
作者:歸藏(guizang.ai)
分类:人工智能
语言:中文
阅读时间:2 分钟
字数:274
标签: DeepSeek, 多模态, 视觉原语, Thinking with Visual Primitives, MoE