很抱歉,当前没有启用javascript,网站无法正常访问。请开启以便继续访问。
DeepSeek-V4系列迎重大升级 性能追平旗舰模型 Agent能力大幅增强
原创
2026-08-02 17:58 星期日
科创板日报 宋子乔
责编 姚辉
①DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,在此基础上,正式版仅重新进行了后训练,基准测试得分远超V4-Pro-Preview;
②机构称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链。

《科创板日报》8月2日讯(编辑 宋子乔) DeepSeek-V4系列模型迎来重大升级。抢在7月最后一天(31日),DeepSeek-V4-Flash正式版上线。

image

根据官方消息,DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,即MoE(混合专家)架构、2840亿总参数、130亿激活参数、1M上下文,在此基础上,正式版仅重新进行了后训练,Agent能力便大幅增强,基准测试得分远超V4-Pro-Preview。

image

官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。相比对标模型,V4 Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4 Flash。

image

具体来看官方给出的9项Agent基准测试得分,在考察终端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分从61.8涨到了82.7;在代码仓库理解与修改任务NL2Repo、DeepSWE上,分别得分54.2和54.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。

另外,其指向网络安全任务的Cybergym得分为76.7,反映工具调用能力的Toolathlon-Verified达到70.3。

在更综合的智能体评测中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分别为25.2和25.1,这两个项目都是2026年新推出、面向AI智能体的现实任务评测基准,用来检验大模型Agent能不能真正完成真实工作,区别于MMLU、Humanity’s Last Exam这类纯问答测试。

在内部全栈开发测试DSBench-FullStack与高难度编码测试DSBench-Hard上,得分则达到68.7和59.6。多项指标远超今年4月上线的V4-Pro预览版。

新版本上线后,Artificial Analysis和Arena.ai两大AI评测平台同步更新了该模型的基准测试结果。

Artificial Analysis智能指数显示,DeepSeek-V4-Flash获得50分,比4月发布的Flash版本高出10分,仅比OpenAI的GPT-5.6 Luna(51分)低1分。该平台发文称,即使OpenAI将GPT-5.6 Luna的价格下调了80%,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%

Arena.ai的报告称,DeepSeek-V4-Flash正式版以1586分的成绩重塑了Frontend Code Arena跑分榜单。每MToken的价格为0.14美元/0.28美元,是同类产品中性价比最高的

申万宏源证券最新研报称,DeepSeek-V4-Flash继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链

12.24W
要闻
股市
关联话题
7.12W 人关注
1.24W 人关注
1.24W 人关注
关于我们|网站声明|联系方式|用户反馈|网站地图|友情链接|举报电话:021-54679377转617举报邮箱:editor@cls.cn财联社举报
财联社 ©2018-2026上海界面财联社科技股份有限公司 版权所有沪ICP备14040942号-9沪公网安备31010402006047号互联网新闻信息服务许可证:31120170007沪金信备 [2021] 2号