DeepSeek 平價 Flash 模型在程式設計任務上超越自家旗艦

新聞摘要
DeepSeek 已正式推出 DeepSeek-V4-Flash-0731,這是其專注於效率的 Mixture-of-Experts 模型的重新訓練版本,目前在九項已發布的智能體與程式設計基準測試中,表現超越了該公司自家的旗艦模型 V4-Pro-Preview。此版本於 2026 年 7 月 31 日(美東時間)確認發布,保留了與早期 V4-Flash Preview 相同的底層架構與參數數量,所有報告中的效能提升皆來自更新的後訓練過程,而非重新設計的模型。
此版本的變更內容
DeepSeek-V4-Flash-0731 是一個擁有 2840 億參數的 Mixture-of-Experts 模型,每個 token 約啟動 130 億個參數,並配備了 100 萬 token 的上下文視窗。根據隨發布一同公布的模型卡,這些改進完全源自重新後訓練——這意味著工程師優化了模型從多步驟任務回饋中學習的方式,而未改變其底層結構或大小。這種方法反映了更廣泛的產業趨勢,即透過更聰明的訓練技術,從現有模型架構中榨取更多能力,而不是單純擴增參數數量。
基準測試亮點
最顯著的結果來自智能體與軟體工程評估。在衡量模型操作命令列環境能力的 Terminal-Bench 2.1 基準測試中,V4-Flash-0731 獲得 82.7 分,領先 V4-Pro-Preview 的 72.1 分,更是較原始 Flash Preview 版本的 61.8 分大幅躍升。在 DeepSWE 程式設計基準測試中,新版本達到了 54.4 分,高於先前版本的 7.3 分——研究人員表示這是在相同模型大小下提升了 645%,凸顯了設計良好的訓練流程能釋放多大的潛在空間。
訓練運作方式
主導此次發布的工程師表示,程式設計與智能體能力的提升依賴於帶有可驗證獎勵的強化學習。實際上,模型會在沙盒環境中嘗試多步驟的程式設計任務,其生成的程式碼會針對測試套件執行,並根據結果評定為通過或失敗。這種二元且絕對真實的訊號隨後被用來強化導致成功結果的動作序列,逐步引導模型進行更可靠的多步驟問題解決。對於建構能夠執行自主、多步驟軟體任務而非單輪文字生成的 AI 系統而言,這種訓練方式已變得越來越普遍。
API 與開發者存取
除了模型更新外,DeepSeek 也推出了對 Responses API 格式的原生支援,這種結構在開發對話與工具使用應用程式的開發者中變得廣受歡迎,並確認與 Codex 風格的程式設計助手相容。在基礎設施方面,該公司表示 V4-Flash 端點能處理約 2500 個並行請求,相比之下,容量較高的 V4-Pro 層級僅約 500 個,這使得 Flash 成為面對客戶的程式設計助手與自動化資料管線等高吞吐量應用更具吸引力的選擇。API 存取定價仍維持在平價層級,公開定價約為每百萬輸入 token 0.14 美元及每百萬輸出 token 0.28 美元,分析師指出這讓該模型對執行大規模或延遲敏感工作負載的開發者保持吸引力。
對全球 AI 社群的重要性
此次發布進一步證明了一個日益增長的觀點:當訓練方法論被優先考慮時,更小、更有效率的模型可以在實用、任務導向的基準測試上匹敵或超越更大的旗艦系統。對於全球的學生、研究人員與獨立開發者而言,此趨勢意義重大:它降低了實驗能夠自主撰寫、測試與反覆運算程式碼的智能體 AI 系統的運算與財務門檻。教育工作者與科技評論家指出,像這樣的發布是一個有用的案例研究,展示了帶有可驗證獎勵的強化學習如何重塑大型語言模型針對真實世界多步驟任務的訓練方式,而非僅僅是預測句子中的下一個詞。
下一步發展
產業觀察家預期 DeepSeek 將繼續在其模型家族中反覆運算這種重新後訓練方法,並可能將類似技術應用於未來的旗艦發布。該公司尚未宣布下一次重大架構更新的具體時間表,但 V4-Flash-0731 的發布表明,漸進式的訓練改進將在 2026 年剩餘的時間裡持續作為其發展策略的核心部分。