首页 / 资讯 / DeepSeek 揭示V4预览版:万亿参数开源模型迈入百万上下文时代
DeepSeek

DeepSeek 揭示V4预览版:万亿参数开源模型迈入百万上下文时代

2026年4月24日1 分钟阅读
DeepSeek 揭示V4预览版:万亿参数开源模型迈入百万上下文时代

新闻摘要

北京时间 2026 年 4 月 24 日,DeepSeek 正式发布并开源了其下一代大语言模型系列 DeepSeek-V4 的预览版,标志着开源人工智能领域的一个重要里程碑。此次发布推出了两个混合专家模型(MoE)变体——DeepSeek-V4-Pro 和 DeepSeek-V4-Flash,均配备标准化的 100 万 token 上下文窗口,可通过 DeepSeek 的 API、官方网页界面以及 Hugging Face 立即获取,并采用 MIT 许可协议。V4-Pro 模型拥有 1.6 万亿总参数,在智能体编码、数学和 STEM 基准测试中声称拥有领先于开源模型的性能,而 V4-Flash 则提供了一个更精简、成本优化的替代方案,面向高频生产工作负载。

两款模型,一次架构飞跃

DeepSeek-V4 以双层系列的形式推出,旨在满足不同的性能和成本要求。旗舰版 DeepSeek-V4-Pro 拥有约 1.6 万亿总参数,其中每次推理 token 仅激活 490 亿参数——这是混合专家架构的设计特点,尽管模型整体规模庞大,但每查询的计算量得到了严格控制。更轻量级的 DeepSeek-V4-Flash 拥有 2840 亿总参数,每次 token 激活 130 亿参数,优先考虑日常任务和面向智能体的任务的响应速度和定价效率。从发布之日(2026 年 4 月 24 日北京时间)起,所有官方 DeepSeek 服务均标配相同的 100 万 token 上下文窗口。

技术架构:DSA、混合注意力机制和 Muon 优化器

V4 系列引入了多项架构创新,使其区别于前代 DeepSeek-V3.2。其中核心是一项新颖的 DSA(动态稀疏注意力)机制,可在 token 层面压缩注意力计算,显著降低处理超长上下文通常所需的内存和计算成本。与之相辅相成的是混合注意力架构,它结合了局部和全局注意力模式——使模型能够在接近一百万 token 的序列中保持连贯的记忆,而不会像传统密集注意力那样出现指数级成本飙升。训练过程采用了流形约束超连接(mHC)以实现稳定的残差信号传播,以及 Muon 优化器,该优化器解决了梯度不稳定性挑战,这些挑战历来使得训练万亿参数的 MoE 模型难以可靠收敛。预训练在超过 32 万亿 token 上使用 FP4 和 FP8 混合精度策略进行。

基准性能和智能体能力

DeepSeek 在预览版发布的同时公布了内部基准测试对比。在 MMLU-Pro 上,据报道 V4-Pro 的表现与 OpenAI 的 GPT-5.4 相当,略逊于 Google 的 Gemini-3.1-Pro。在智能体编码评估中,V4-Pro 声称在所有公开评估的开源模型中位居榜首,并据报道已成为 DeepSeek 自身内部工程团队使用的主要智能体编码工具。在 Codeforces 等竞争性编程基准测试中,V4-Pro 的得分可与领先的闭源前沿模型相媲美。100 万 token 规模的长上下文检索基准测试显示出具有竞争力但并非领先的结果,顶级闭源产品在某些长上下文记忆测试中仍具有优势。DeepSeek 指出,这些是预览阶段的数据,独立的第三方评估尚未公布。

API 可用性和开发者访问

V4 系列可通过 DeepSeek 的官方 API 使用,模型标识符分别为 deepseek-v4-prodeepseek-v4-flash。API 支持标准和推理(思考模式)配置,并新增了 reasoning_effort 参数,可针对代码生成和多文档处理等复杂任务调整思考强度级别(高/最大)。开源模型权重通过 Hugging Face 和 ModelScope 分发,采用 MIT 许可协议,允许开发者下载、本地运行和修改模型。DeepSeek 宣布,旧版模型标识符 deepseek-chatdeepseek-reasoner(之前映射到 V3.2)将于 2026 年 7 月 24 日(北京时间)弃用,为开发者提供三个月的迁移窗口。

多模态路线图和芯片基础设施

当前的 V4 预览版仅支持文本。DeepSeek 在其 Hugging Face 公告中表示,团队正在积极开发多模态能力——这意味着未来版本有望处理图像和视频输入以及文本。另外,华为于 2026 年 4 月 24 日(北京时间)确认,其由 Ascend 950 AI 处理器驱动的 Ascend 超级节点集群完全支持 DeepSeek-V4 模型系列。DeepSeek 在预览版发布文档中并未披露华为 Ascend 芯片在 V4 训练中所占的确切比例。

开源战略和融资背景

DeepSeek 一直坚持开源模型分发战略,V4 在宽松的 MIT 许可协议下延续了这一方法。据报道,该公司同时正在进行首次外部融资,目标估值超过 200 亿美元。V4 的发布使 DeepSeek 成为专有前沿人工智能系统的直接开源竞争对手,其成本效益理念——庞大的总参数量与少量激活参数相结合——仍然是其商业和开发者吸引力的核心。预览版标签表明,最终的、经过全面验证的、包含完整训练披露的版本仍将发布,但未在 4 月 24 日的发布会上公布严格的最终确定时间表。

DeepSeek开源AI