gubit.cn-股比特.中国
查股网
AI应用(广告营销)概念板块热点狙击|实时新闻事件驱动
 
沪深个股板块DDE历史数据查询:    
 

DeepSeek-V4系列迎重大升级 性能追平旗舰模型 Agent能力大幅增强

http://gubit.cn  2026-08-03 08:33  AI应用(广告营销)板块热点狙击
蓝色光标
14.72+2.58%
汉得信息
16-3.9%
易点天下
32.34+6.07%
天龙集团
9.05-0.55%
利欧股份
5.13+10.09%
DeepSeek-V4系列模型迎来重大升级。抢在7月最后一天(31日),DeepSeek-V4-Flash正式版上线。

根据官方消息,DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,即MoE(混合专家)架构、2840亿总参数、130亿激活参数、1M上下文,在此基础上,正式版仅重新进行了后训练,Agent能力便大幅增强,基准测试得分远超V4-Pro-Preview。

官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。相比对标模型,V4 Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4 Flash。

具体来看官方给出的9项Agent基准测试得分,在考察终端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分从61.8涨到了82.7;在代码仓库理解与修改任务NL2Repo、DeepSWE上,分别得分54.2和54.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。

另外,其指向网络安全任务的Cybergym得分为76.7,反映工具调用能力的Toolathlon-Verified达到70.3。

在更综合的智能体评测中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分别为25.2和25.1,这两个项目都是2026年新推出、面向AI智能体的现实任务评测基准,用来检验大模型Agent能不能真正完成真实工作,区别于MMLU、Humanity’s Last Exam这类纯问答测试。

在内部全栈开发测试DSBench-FullStack与高难度编码测试DSBench-Hard上,得分则达到68.7和59.6。多项指标远超今年4月上线的V4-Pro预览版。

新版本上线后,Artificial Analysis和Arena.ai两大AI评测平台同步更新了该模型的基准测试结果。

Artificial Analysis智能指数显示,DeepSeek-V4-Flash获得50分,比4月发布的Flash版本高出10分,仅比OpenAI的GPT-5.6 Luna(51分)低1分。该平台发文称,即使OpenAI将GPT-5.6 Luna的价格下调了80%,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%。

Arena.ai的报告称,DeepSeek-V4-Flash正式版以1586分的成绩重塑了Frontend Code Arena跑分榜单。每MToken的价格为0.14美元/0.28美元,是同类产品中性价比最高的。

申万宏源证券最新研报称,DeepSeek-V4-Flash继续展现国产模型超高性价比; 国联民生 证券称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链

来源:新浪财经

免责条款:★★以上摘录不保证没有疏漏,仅供参考!★★
有问题请联系 767871486@qq.com 商务合作广告联系 QQ:767871486
查股网以"免费 简单 客观 实用"为原则,致力于为广大股民提供最有价值和实用的股票数据作参考!
Copyright 2007-2026
www.gubit.cn 查股网