首页 / 资讯 / DeepSeek 经济型 Flash 模型在编程任务上反超自家旗舰模型
DeepSeek

DeepSeek 经济型 Flash 模型在编程任务上反超自家旗舰模型

2026年8月1日5 分钟阅读
DeepSeek 经济型 Flash 模型在编程任务上反超自家旗舰模型

新闻摘要

DeepSeek 正式推出了 DeepSeek-V4-Flash-0731,这是其注重效率的混合专家模型的重新训练版本,目前在九项已公布的智能体和编程基准测试中,其表现超越了公司自家的旗舰模型 V4-Pro-Preview。此次发布于 2026 年 7 月 31 日(美东时间)确认,保留了与早期 V4-Flash Preview 相同的基础架构和参数量,所有报告的提升均来自更新的训练后处理过程,而非重新设计的模型。

本次版本的改进之处

DeepSeek-V4-Flash-0731 是一个拥有 2840 亿参数的混合专家模型,每个 token 激活约 130 亿参数,并配有 100 万 token 的上下文窗口。根据随发布一同公布的模型说明卡,这些改进完全源于重新进行的训练后处理——这意味着工程师优化了模型从多步任务反馈中学习的方式,而没有改变其底层结构或规模。这种方法反映了行业内的一个更广泛趋势,即通过更智能的训练技术从现有模型架构中挖掘更多能力,而不是简单地扩大参数规模。

基准测试亮点

最显著的结果来自智能体和软件工程评估。在 Terminal-Bench 2.1(一项衡量模型操作命令行环境能力的基准测试)中,V4-Flash-0731 得分为 82.7,领先于 V4-Pro-Preview 的 72.1,并且较原始 Flash Preview 版本的 61.8 有大幅提升。在 DeepSWE 编程基准测试中,新版本得分达到 54.4,高于此前版本的 7.3——研究人员称这一改进为 645% 的提升,且是在相同模型规模下实现的,这凸显了设计良好的训练流程能够释放多大的潜力。

训练机制解析

负责此次发布的工程师表示,编程和智能体能力的提升依赖于带有可验证奖励的强化学习。具体而言,模型在沙盒环境中尝试多步编程任务,其生成的代码会针对测试套件执行,结果被判定为通过或失败。这种二元的真实信号随后被用来强化促成成功结果的动作序列,逐步引导模型实现更可靠的多步问题解决。这种训练方式在构建能够自主执行多步软件任务(而非单轮文本生成)的 AI 系统中变得越来越普遍。

API 与开发者接入

在模型更新的同时,DeepSeek 推出了对 Response API 格式的原生支持,这种结构在构建对话和工具调用应用的开发者中很受欢迎,并确认了与 Codex 风格编程助手的兼容性。在基础设施方面,公司表示 V4-Flash 接口可处理约 2500 个并发请求,而容量更高的 V4-Pro 级别约为 500 个,这使得 Flash 成为面向客户的编程助手和自动化数据管道等高吞吐量应用更具吸引力的选择。API 接入定价仍处于经济型档次,公开标价约为每百万输入 token 0.14 美元,每百万输出 token 0.28 美元。分析人士指出,这使其对运行大规模或对延迟敏感工作负载的开发者保持吸引力。

对全球 AI 社区的意义

此次发布进一步证明了一个日益明确的趋势:当优先考虑训练方法时,更小、更高效的模型可以在面向实际任务的基准测试中匹敌甚至超越更大的旗舰系统。对于全球的学生、研究人员和独立开发者而言,这一趋势意义重大:它降低了试验智能体 AI 系统的计算和资金门槛,这些系统能够自主编写、测试和迭代代码。教育工作者和科技评论员指出,此类发布是一个很好的案例研究,展示了带有可验证奖励的强化学习如何重塑大语言模型针对现实世界多步任务的训练方式,而不仅仅是预测句子中的下一个词。

后续展望

行业观察人士预计,DeepSeek 将继续在其模型系列中迭代这种重新训练后处理的方法,并可能将类似技术应用于未来的旗舰版本发布。该公司尚未宣布下一次重大架构更新的具体时间表,但 V4-Flash-0731 的发布表明,渐进式的训练改进仍将是其 2026 年剩余时间发展战略的核心部分。

DeepSeekAI models