DeepSeek 正式发布并开源 V4 系列模型,包含 1.6T 总参数的 Pro 版和 284B 总参数的 Flash 版,在多项基准测试中达到开源 SOTA,API 定价极低,并引入三项关键架构升级。
📝 详细摘要
本文报道了 DeepSeek-V4 系列模型的发布。该系列包含两个版本:总参数 1.6T、激活参数 49B 的 V4 Pro,以及总参数 284B、激活参数 13B 的 V4 Flash。DeepSeek 宣称 V4 Pro 在 Agentic 编码、数学/STEM/编程等基准测试中达到开源 SOTA,性能可媲美顶级闭源模型。V4 Flash 则主打高性价比,其 API 输出定价仅为 0.28 美元/百万 token。文章还介绍了 V4 的三项核心架构升级:流形约束超连接、混合注意力机制(包含压缩稀疏注意力和重度压缩注意力)和 DeepSeekMoE 优化,这些创新使其在 1M token 上下文下,推理 FLOPs 仅为 V3.2 的 27%,KV 缓存大小仅为 10%。此外,V4 已与 Claude Code、OpenClaw 等 Agent 工具集成,并支持 100 万 token 上下文和最高 38.4 万 token 输出。文章最后从技术、产业和战略三个层面阐述了 V4 的意义,认为其证明了中国开源 AI 路径的可行性。
💡 主要观点
- DeepSeek-V4 系列发布,包含 Pro 和 Flash 两个版本,均开源。 Pro 版总参数 1.6T,是目前最大开源模型,性能对标顶级闭源模型;Flash 版参数更小,主打高性价比,API 输出定价仅 0.28 美元/百万 token。
💬 文章金句
- 1.6T 的总参数,是目前最大的开源模型!
- DeepSeek-V4 在 DeepSeek-V3 的基础上引入了三项关键架构升级:流形约束超连接、混合注意力机制和 DeepSeekMoE 优化。
- V4 达到了世界领先的长下文容量,并大幅降低了内存成本。
- 世界正分裂成'西方闭源收费路径和'中国开源普惠路径',而 V4 让后者越来越香。
📊 文章信息
AI 初评:86
来源:51CTO技术栈
作者:51CTO技术栈
分类:人工智能
语言:中文
阅读时间:8 分钟
字数:1892
标签: DeepSeek-V4, 开源模型, 大语言模型, 模型架构, AI Agent