软盟资讯 | 前沿科技
2026年7月31日,DeepSeek通过API文档更新日志宣布,DeepSeek-V4-Flash正式版API上线公测。
消息一出,开发者社区瞬间”炸了”。
原因很简单——DeepSeek官方公布的9项Agent基准测试数据显示,这款定位”轻量快速”的Flash正式版,在智能体能力上全面超越了自家4月份发布的V4-Pro-Preview。
“以下克上”的剧情,在大模型赛道里并不常见。更何况,Flash的参数量仅有Pro的六分之一。
这到底是怎么做到的?
一、Agent能力全面跃升:9项基准测试成绩单
DeepSeek没有藏着掖着,直接亮出了9项Agent基准测试的完整成绩单:
| 基准测试 | 得分 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon Verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench Public | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
官方明确指出,这些结果远超DeepSeek-V4-Pro-Preview。
其中几个关键测试值得关注:
Terminal Bench 2.1(82.7分)——测试模型在终端环境下的任务执行能力,包括理解命令行操作、编写脚本、调试错误。这个分数意味着V4-Flash已经具备了”AI运维工程师”级别的表现。
Cybergym(76.7分)——网络安全对抗测试,衡量模型在安全场景中的智能决策能力。
DeepSWE(54.4分)——从预览版的7.3飙升至54.4,暴涨超过7倍。这是代码智能体领域最硬核的基准之一,直接反映了模型在真实软件工程任务中的表现。
DSBench-FullStack(68.7分)和DSBench-Hard(59.6分)——DeepSeek内部的全栈开发和难题测试集,证明模型不仅能写单个函数,还能胜任从前端到后端的完整开发链路。
在社区评测中,V4-Flash正式版的表现已超过智谱GLM-5.2,并进一步逼近Claude Opus 4.8。有第三方评测机构指出,DeepSeek V4 Flash是首个被团队直接投入真实Agent流水线中、作为Anthropic或OpenAI级别前沿模型替代品的开源权重模型。
二、技术内核:同样架构,更强能力
这次更新最值得关注的技术细节是:模型结构没变,但能力大幅提升。
DeepSeek-V4-Flash-0731的模型结构、尺寸与Preview版保持完全一致——总参数284B,激活参数仅13B,MoE架构,原生支持100万Token超长上下文。
唯一的变量是:重新进行了后训练(Post-Training)。
这个细节传递出一个重要信号:后训练环节的优化,同样可以带来Agent能力的巨大提升。 在不改变模型架构和参数规模的前提下,通过更高质量的后训练数据、更优的训练策略,就能让模型在Agent任务上实现质的飞跃。
对于整个行业而言,这意味着大模型的竞争逻辑正在发生转变——从”堆参数”转向”精调优”。 同样的底座,经过更精细的后训练,就能在基准测试中产生质的飞跃。
三、原生支持Responses API,适配Codex生态
正式版V4-Flash的另一大亮点,是原生支持OpenAI Responses API格式,并针对Codex完成专项适配。
这意味着什么?开发者只需一次配置,即可在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中直接调用DeepSeek V4-Flash,无需第三方桥接工具。base_url不变,将模型名切换为deepseek-v4-flash即可完成迁移。
对于日常使用AI辅助编程的开发者来说,这是一个非常实用的升级。V4-Flash可以无缝接入主流开发工具,帮助写代码、查Bug,甚至完成简单的项目搭建。
不过需要注意的是,Responses API目前仅支持V4-Flash模型,暂不支持V4-Pro。DeepSeek官方表示,Pro版的支持预计在8月初跟进。
四、极致性价比:小模型的价格,接近旗舰的性能
在成本层面,V4-Flash的定价策略延续了DeepSeek一贯的”价格屠夫”风格。
| 场景 | 价格(每百万Token) |
|---|---|
| 输入(缓存命中) | 0.2元 |
| 输入(缓存未命中) | 1元 |
| 输出 | 2元 |
非高峰时段,百万输出Token仅需0.28美元,极致性价比。有分析指出,V4-Flash是小模型中成本最低的选项,甚至低于OpenAI的GPT-5.4 Nano。
284B总参数、13B激活参数的MoE架构,配合稀疏注意力机制,大幅降低了显存与算力消耗。在100万Token超长上下文场景下,单Token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。
用更便宜的价格,交出更强的干活能力——这就是”低价不等于低能”的最好证明。
五、V4-Pro正式版:即将到来
官方特别说明,本次升级仅覆盖DeepSeek-V4-Flash的API接口,DeepSeek-V4-Pro的API及APP/Web端模型均未做更改。
关于V4-Pro正式版,官方表示”将尽快发布”。有媒体报道称,V4-Pro正式版极有可能于8月3日正式上线。
作为V4系列中的旗舰模型,V4-Pro采用MoE架构,总参数规模达1.6T,单次推理激活参数为49B,同样支持100万Token超长上下文。在预览版阶段,V4-Pro在Agentic Coding评测中已达到开源模型最佳水平,在数学、STEM学科能力、竞赛级代码能力上超越所有已公开评测的同类开源模型。
更值得期待的是,如果V4-Pro正式版也像Flash版一样经历后训练优化,其Agent能力的高度可能会更加惊人。
六、行业观察:AI竞赛进入”精调时代”
DeepSeek V4 Flash正式版的发布,释放了几个清晰的行业信号。
第一,价格战拼的是入场券,Agent能力才是决赛圈。 过去半年,国产大模型在占据价格优势的同时,也在疯狂补齐Agent和Coding的短板。DeepSeek-V4-Flash正式版用更便宜的价格交出了更强的能力,证明了低价不等于低能。
第二,后训练成为新的竞争焦点。 同样的模型架构,经过更精细的后训练,就能在Agent能力上产生质的飞跃。这意味着,在”堆参数”的军备竞赛之外,还有一条更务实的路径——把已有的模型”调教”得更好。
第三,开源模型正在逼近闭源旗舰。 V4-Flash正式版在多项Agent基准上逼近Claude Opus 4.8,这在半年前还是不可想象的事情。开源模型与闭源旗舰之间的差距,正在以肉眼可见的速度缩小。
对于开发者而言,这无疑是一个好消息。更低的成本、更强的能力、更丰富的生态——AI Agent时代的门槛,正在被DeepSeek一步步拉低。
(本文数据综合自DeepSeek官方API文档、凤凰网科技、智东西、CSDN、网易智能等公开报道。)
关于文章版权的声明:
https://news.softunis.com/66203.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

