← 回總覽

DeepSeek,V4 系列迎重大升级

📅 2026-08-02 18:17 财联社 人工智能 2 分鐘 1720 字 評分: 83
DeepSeek 大模型 AI模型 性能评测 成本优势
📌 一句话摘要 DeepSeek-V4-Flash 正式版发布,性能超越国产 GLM-5.2 并逼近 Opus 4.8,成本优势显著,获多家机构看好。 📝 详细摘要 DeepSeek-V4-Flash 正式版在 7 月 31 日上线,模型架构、总参数(2840 亿)、激活参数(130 亿)和上下文长度(1M)与预览版保持一致,仅通过后训练显著提升 Agent 能力。官方基准测试显示,其在 Terminal Bench2.1 上得分从 61.8 提升至 82.7,在 NL2Repo 和 DeepSWE 上分别得到 54.2 和 54.4,远超之前的 V4-Pro 预览版。整体性能超越国产编程

📌 一句话摘要

DeepSeek-V4-Flash 正式版发布,性能超越国产 GLM-5.2 并逼近 Opus 4.8,成本优势显著,获多家机构看好。

📝 详细摘要

DeepSeek-V4-Flash 正式版在 7 月 31 日上线,模型架构、总参数(2840 亿)、激活参数(130 亿)和上下文长度(1M)与预览版保持一致,仅通过后训练显著提升 Agent 能力。官方基准测试显示,其在 Terminal Bench2.1 上得分从 61.8 提升至 82.7,在 NL2Repo 和 DeepSWE 上分别得到 54.2 和 54.4,远超之前的 V4-Pro 预览版。整体性能超越国产编程模型 GLM-5.2,逼近美国 Opus 4.8;在 Artificial Analysis 智能指数上得到 50 分,仅比 GPT-5.6 Luna 低 1 分,且单任务成本比后者低约 60%。Arena.ai 报告显示其在 Frontend Code Arena 中以 1586 分夺魁,每 MToken 价格仅 0.14/0.28 美元,性价比最高。申万宏源和国联民生证券均发表看好评价,认为该模型展现国产模型超高性价比,利好 AI 应用产业链。

💡 主要观点

- 模型架构与参数保持不变,仅后训练提升 Agent 能力。 正式版沿用 MoE 架构、2840 亿总参数、130 亿激活参数和 1M 上下文,通过后训练使代理任务得分大幅提升。

在多项 Agent 基准测试中表现突出,Terminal Bench2.1 得分提升至 82.7。 相比预览版的 61.8,正式版在终端操作能力测试中显著提升,且在代码仓库理解与修改任务上也取得 54.2/54.4 的高分。
性能超越国产 GLM-5.2 并逼近美国 Opus 4.8,成本优势显著。 官方及第三方评测表明其整体性能已超过 GLM-5.2,接近 Opus 4.8;在 Artificial Intelligence 指数上仅低 1 分,且单任务成本比 GPT-5.6 Luna 低约 60%。
机构看好其在 AI 应用产业链中的价值,称其性价比高且利好产业链。 申万宏源称国产模型超高性价比,国联民生证券认为轻量模型已追平旗舰性能,均看好其推动 AI 应用发展。

💬 文章金句

- 即使 OpenAI 将 GPT-5.6 Luna 的价格下调了 80%,DeepSeek-V4-Flash 正式版在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna 低约 60%

  • DeepSeek-V4-Flash 正式版的整体性能超过了 GLM-5.2,逼近 Opus 4.8
  • DeepSeek-V4-Flash 正式版以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。每 MToken 的价格为 0.14 美元/0.28 美元,是同类产品中性价比最高的
  • 在考察终端操作能力的 Terminal Bench2.1 上,DeepSeek-V4-Flash 正式版的得分从 61.8 涨到了 82.7

📊 文章信息

AI 初评:83

来源:财联社

作者:财联社

分类:人工智能

语言:中文

阅读时间:5 分钟

字数:1240

标签: DeepSeek, 大模型, AI模型, 性能评测, 成本优势

阅读完整文章

查看原文 → 發佈: 2026-08-02 18:17:00 收錄: 2026-08-02 22:00:08

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。