DeepSeek-V4-Flash 正式版发布,性能超越国产 GLM-5.2 并逼近 Opus 4.8,成本优势显著,获多家机构看好。
📝 详细摘要
DeepSeek-V4-Flash 正式版在 7 月 31 日上线,模型架构、总参数(2840 亿)、激活参数(130 亿)和上下文长度(1M)与预览版保持一致,仅通过后训练显著提升 Agent 能力。官方基准测试显示,其在 Terminal Bench2.1 上得分从 61.8 提升至 82.7,在 NL2Repo 和 DeepSWE 上分别得到 54.2 和 54.4,远超之前的 V4-Pro 预览版。整体性能超越国产编程模型 GLM-5.2,逼近美国 Opus 4.8;在 Artificial Analysis 智能指数上得到 50 分,仅比 GPT-5.6 Luna 低 1 分,且单任务成本比后者低约 60%。Arena.ai 报告显示其在 Frontend Code Arena 中以 1586 分夺魁,每 MToken 价格仅 0.14/0.28 美元,性价比最高。申万宏源和国联民生证券均发表看好评价,认为该模型展现国产模型超高性价比,利好 AI 应用产业链。
💡 主要观点
- 模型架构与参数保持不变,仅后训练提升 Agent 能力。 正式版沿用 MoE 架构、2840 亿总参数、130 亿激活参数和 1M 上下文,通过后训练使代理任务得分大幅提升。
💬 文章金句
- 即使 OpenAI 将 GPT-5.6 Luna 的价格下调了 80%,DeepSeek-V4-Flash 正式版在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna 低约 60%
- DeepSeek-V4-Flash 正式版的整体性能超过了 GLM-5.2,逼近 Opus 4.8
- DeepSeek-V4-Flash 正式版以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。每 MToken 的价格为 0.14 美元/0.28 美元,是同类产品中性价比最高的
- 在考察终端操作能力的 Terminal Bench2.1 上,DeepSeek-V4-Flash 正式版的得分从 61.8 涨到了 82.7
📊 文章信息
AI 初评:83
来源:财联社
作者:财联社
分类:人工智能
语言:中文
阅读时间:5 分钟
字数:1240
标签: DeepSeek, 大模型, AI模型, 性能评测, 成本优势