DeepSeek悄然发布V4-Pro:1.6万亿参数,100万Token上下文,每百万Token仅0.87美元

新闻摘要
DeepSeek悄然发布了其旗舰大语言模型DeepSeek-V4-Pro-0813的正式版本,该模型已从预览状态转正,没有博客文章,没有新闻发布会,也没有正式公告。该版本出现在公司官方API文档和Hugging Face上,目前开发者可通过API使用,消费者可通过chat.deepseek.com使用。截至2026年8月13日美国东部时间上午6:00,该模型已全面可用,此前DeepSeek-V4系列于2026年4月24日首次发布预览版。
低调发布
此次发布与DeepSeek首次引起全球关注时的情形形成鲜明对比。2025年1月20日DeepSeek-R1发布时,引发了剧烈的市场反应,导致Nvidia市值在一周内蒸发了约5930亿美元。而V4-Pro-0813的更新则毫无此类轰动效应。关注该公司Hugging Face仓库和API更新日志的工程师和研究人员率先注意到新版本已取代预览版,这凸显了快速发展的实验室中大型模型更新已变得多么常规。
底层变化
DeepSeek-V4-Pro基于专家混合(MoE)架构,总参数达1.6万亿,其中每个Token激活490亿参数。与上一代DeepSeek-V3(总参数6710亿,激活参数370亿)相比,V4-Pro的总参数约为其2.4倍,每个Token的激活计算量约为其1.3倍。
最显著的架构升级在于长上下文处理能力。模型的上下文窗口扩大了8倍,从V3的128,000个Token扩展到V4-Pro的100万个Token,最大输出长度为384,000个Token。这得益于一种新的混合注意力机制,该机制结合了压缩稀疏注意力(CSA)和重度压缩注意力(HCA),以及公司所称的流形约束超连接(mHC)技术。根据DeepSeek的技术报告,在完整的100万Token上下文长度下,V4-Pro仅需约早期DeepSeek-V3.2模型单Token推理计算量的27%和键值缓存内存的10%。
V4系列还包括一个较小的兄弟模型DeepSeek-V4-Flash,总参数2840亿,激活参数130亿,专为更快、更高吞吐量的工作负载设计。两个模型均保留了DeepSeekMoE框架和V3中引入的多Token预测策略,并均以MIT许可证开放权重发布,同时附带完整技术报告和Hugging Face模型卡。
定价与市场定位
DeepSeek-V4-Pro-0813通过API的定价约为每百万输入Token 0.435美元,每百万输出Token 0.87美元。这一价格远低于西方实验室的同类前沿模型,一些行业对比显示,顶级竞争模型的输入和输出成本分别为每百万Token 10美元和50美元左右。
基准测试表现
目前尚未完成对厂商报告数据的独立复现,因此以下基准测试结果应视为DeepSeek自行报告的数据。在广泛使用的编程基准SWE-bench Verified上,V4-Pro得分80.6,与其他领先模型大致持平,仅比顶级闭源竞争对手低零点几分。在SWE-bench Pro(被视为生产级编程能力的代理指标)上,V4-Pro得分55.4%,落后最佳闭源模型近9个百分点。在Terminal-Bench 2.0上,V4-Pro得分67.9%,与领先闭源结果相差约1.5个百分点。
在更广泛的九个智能体基准测试中(存在可比较分数),最强的闭源竞争对手平均领先约5个百分点;若排除一个异常基准,差距缩小至不到3个百分点,而DeepSeek-V4-Pro在九项指标中的两项上实际领先。
低调发布的意义
行业观察人士指出,这种低调的发布风格反映了前沿实验室现在发布模型更新的频率,以及即使底层性能提升显著,此类更新也变得多么常规。对于评估大语言模型的开发者和企业而言,接近前沿的基准测试性能加上远低于西方领先替代品的每Token成本,使DeepSeek-V4-Pro成为成本敏感型大规模部署的值得关注的选择,尤其是考虑到其扩展的100万Token上下文窗口,特别适合长文档分析场景。
后续关注点
由于随V4-Pro-0813发布的基准数据为厂商自行报告,预计独立评估机构和第三方排行榜将在未来几周发布各自的复现结果,这将更清晰地展示该模型在DeepSeek自身测试环境之外的表现。有兴趣尝试该模型的开发者可通过DeepSeek API或chat.deepseek.com上的专家模式和即时模式立即访问,研究人员可在与Hugging Face发布同步发布的DeepSeek-V4技术报告中查看完整架构细节。