DeepSeek 低調推出 V4-Pro:1.6 兆參數、100 萬 Token 上下文、每百萬 Token 僅 0.87 美元

新聞摘要
DeepSeek 已低調推出其旗艦大型語言模型的正式版本 DeepSeek-V4-Pro-0813,將系統從預覽狀態轉為正式版,沒有發布部落格文章、沒有舉辦記者會、也沒有正式公告。該版本出現在公司的官方 API 文件和 Hugging Face 上,目前開發者可透過 API 使用,一般使用者則可透過 chat.deepseek.com 存取。截至 2026 年 8 月 13 日美國東部時間上午 6:00,該模型已全面開放,此前 DeepSeek-V4 系列於 2026 年 4 月 24 日首次發布預覽版。
低調發布
這次的推出與 DeepSeek 首次登上全球舞台的時刻形成鮮明對比。DeepSeek-R1 於 2025 年 1 月 20 日發布時,引發了劇烈的市場反應,導致 Nvidia 市值在一週內蒸發約 5,930 億美元。而 V4-Pro-0813 的更新完全沒有引起這樣的轟動。關注該公司 Hugging Face 儲存庫和 API 變更記錄的工程師和研究人員,是最先注意到新版本已取代預覽版的一群人,這也凸顯了對於這家快速發展的實驗室而言,大型模型的例行更新已成為常態。
內部有哪些改變
DeepSeek-V4-Pro 採用專家混合(MoE)架構,總參數達 1.6 兆,其中每個 Token 會啟動 490 億個參數。與前代 DeepSeek-V3(總參數 6,710 億、活躍參數 370 億)相比,V4-Pro 的總參數約為前者的 2.4 倍,每個 Token 的活躍運算量約為前者的 1.3 倍。
最重要的架構升級在於長上下文處理能力。模型的上下文視窗擴大了 8 倍,從 V3 的 128,000 個 Token 增加到 V4-Pro 的 100 萬個 Token,最大輸出長度為 384,000 個 Token。這得益於全新的混合注意力機制,結合了壓縮稀疏注意力(CSA)和重度壓縮注意力(HCA),以及該公司稱之為「流形約束超連線」(mHC)的技術。根據 DeepSeek 的技術報告,在完整的 100 萬 Token 上下文長度下,V4-Pro 所需的單 Token 推論運算量僅為先前 DeepSeek-V3.2 模型的約 27%,鍵值快取記憶體僅需 10%。
V4 系列還包含一個較小的兄弟模型 DeepSeek-V4-Flash,這是一個 2,840 億參數的模型,活躍參數為 130 億,專為更快、更高吞吐量的工作負載而設計。兩個模型都保留了 DeepSeekMoE 框架和 V3 引入的多 Token 預測策略,並且都以 MIT 授權開放權重發布,同時附上完整的技術報告和 Hugging Face 模型卡。
定價與市場定位
DeepSeek-V4-Pro-0813 透過 API 的定價約為每百萬輸入 Token 0.435 美元、每百萬輸出 Token 0.87 美元。這個定價遠低於西方實驗室的同級前沿模型,一些業界比較指出,頂級競爭對手的輸入和輸出成本分別約為每百萬 Token 10 美元和 50 美元。
基準測試表現
目前尚未有獨立機構重現廠商報告的數據,因此以下基準測試結果應視為 DeepSeek 自行報告的數據。在廣泛使用的程式碼基準測試 SWE-bench Verified 上,V4-Pro 得分 80.6,與其他領先模型大致持平,僅落後頂級閉源競爭對手不到一個百分點。在被視為生產級程式碼能力指標的 SWE-bench Pro 上,V4-Pro 得分 55.4%,落後最佳閉源模型近 9 個百分點。在 Terminal-Bench 2.0 上,V4-Pro 得分 67.9%,與領先的閉源結果差距約 1.5 個百分點。
在更廣泛的九個代理導向基準測試中(這些測試有可比較的分數),最強的閉源競爭對手平均領先約 5 個百分點;若排除一個離群基準,差距縮小至不到 3 個百分點,而 DeepSeek-V4-Pro 在九項指標中的兩項上實際上領先。
低調發布的意義
業界觀察家指出,這種低調的發布風格反映了前沿實驗室發布模型更新的頻率已大幅提升,即使底層效能提升顯著,這類更新也變得越來越例行公事。對於評估大型語言模型的開發者和企業而言,接近前沿的基準測試效能加上僅為西方領先替代方案每 Token 成本一小部分的價格,使 DeepSeek-V4-Pro 成為成本敏感、大規模部署的值得關注的選擇,尤其是考慮到模型擴展至 100 萬 Token 的上下文視窗,特別適合長文件分析。
接下來觀察重點
由於隨 V4-Pro-0813 發布的基準測試數據為廠商自行報告,預計獨立評估機構和第三方排行榜將在未來幾週內發布各自的複現結果,這將更清楚地呈現該模型在 DeepSeek 自身測試環境之外的表現。有興趣嘗試該模型的開發者可以立即透過 DeepSeek API 或 chat.deepseek.com 上的 Expert Mode 和 Instant Mode 選項存取,研究人員則可查閱隨 Hugging Face 發布的 DeepSeek-V4 技術報告,了解完整的架構細節。