DeepSeek-V4-Flash正式版API公测上线!

📅 发布时间:2026/8/3 14:53:36
DeepSeek-V4-Flash正式版API公测上线! 整理 | 梦依丹出品 | CSDNIDCSDNnews7月31日DeepSeek正式向公众开放V4-Flash正式版API公测。这一次最亮眼的关键词是——Agent能力大幅跃升。9项基准测试成绩全面披露多项指标远超此前发布的V4-Pro-Preview预览版直接将“代码智能体”的天花板又顶高了一截。从Terminal Bench到DSBench-Hard从网络安全对抗到全栈开发DeepSeek-V4-Flash正式版展现出了令人瞩目的“全能Agent”潜质。这意味着什么意味着AI不再只是“能写代码”而是开始真正像工程师一样工作——打开终端、分析仓库、调用工具、完成端到端任务。9项基准测试成绩单数据说话这一次DeepSeek没有藏着掖着直接亮出了9项基准测试的完整成绩。从终端操作到代码仓库分析从网络安全到自动化测试覆盖面相当广泛。其中Terminal Bench 2.1以82.7的高分领跑这意味着模型在终端环境下的任务执行能力已经相当成熟——能够理解复杂的命令行操作、编写脚本、调试错误几乎是“AI运维工程师”级别的表现。Cybergym拿下76.7分展示了出色的网络安全对抗能力。DSBench-FullStack全栈开发测试和DSBench-HardCoding Agent难题测试分别取得68.7和59.6分说明模型不仅能够写单个函数还能胜任从前端到后端的完整开发链路。测试说明透明且严谨DeepSeek同时披露了详细的测试条件透明度值得点赞注1对于公开基准测试集中的Code Agent任务正式版DeepSeek-V4-Flash使用DeepSeek Harness极简模式即将发布作为框架进行测试并使用max档位top_p0.95temperature1.0。注2DSBench-FullStack是内部使用的全栈开发测试集DSBench-Hard是内部使用的Coding Agent难题测试集。值得一提的是DeepSeek Harness极简模式作为一个即将独立发布的测试框架此次随成绩一同亮相也暗示了DeepSeek在构建标准化Agent评测生态方面的布局——不只是训练更强的模型还要提供更可靠的评测工具。原生支持Responses API适配Codex除了基准成绩的飞跃正式版V4-Flash在工程适配上也有重要更新——原生支持Responses API格式并针对性适配了Codex。这意味着开发者可以更自然地将V4-Flash接入现有的Codex工作流降低迁移成本。具体配置方法可参考DeepSeek官方文档。模型结构未变后训练是关键一个值得注意的细节是DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致仅重新进行了后训练。换句话说底座没有变变的是后天教育。这恰恰说明在Agent能力这条赛道上后训练策略的优化空间依然巨大。同样的模型架构经过更精细的后训练调优就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。此次升级范围仅限V4-Flash API升级范围说明已升级DeepSeek-V4-Flash API接口未升级DeepSeek-V4-Pro API未升级APP端 / WEB端模型即将发布DeepSeek-V4-Pro正式版将尽快发布需要注意的是本次升级仅涉及DeepSeek-V4-Flash的API接口。如果你是V4-Pro的用户或者是通过APP/Web端使用DeepSeek的用户此次更新暂不影响你。而关于大家关心的V4-Pro正式版DeepSeek表示将尽快发布。考虑到Flash版已经展现出如此强势的Agent能力V4-Pro正式版的表现无疑更加令人期待。行业观察Agent时代正式开启从Terminal Bench到Cybergym从DeepSWE到Toolathlon这9项基准测试的名字本身就揭示了一个趋势AI的能力评测正在从写一段代码进化到完成一个工程任务。DeepSeek-V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview释放了一个明确信号——后训练时代的竞争焦点已经从模型规模转向了Agent能力的深度优化。当AI能够熟练地操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时我们或许正在见证一个新时代的开启AI不再只是代码助手而是成为了真正的AI工程师。而DeepSeek正在这条路上跑在最前面。