DeepSeekの低コストFlashモデルがコーディングタスクで自社のフラッグシップを上回る

ニュース概要
DeepSeekは、効率性に焦点を当てたMixture-of-Expertsモデルを再学習したDeepSeek-V4-Flash-0731を正式にリリースしました。このモデルは、公開されている9つのエージェントおよびコーディングベンチマークにおいて、自社のフラッグシップであるV4-Pro-Previewを上回る性能を発揮しています。2026年7月31日(東部時間)に確認された今回のリリースでは、以前のV4-Flash Previewと同じ基本アーキテクチャとパラメータ数が維持されており、報告されているすべての性能向上はモデルの再設計ではなく、更新された学習後プロセスによるものです。
今回のビルドでの変更点
DeepSeek-V4-Flash-0731は、2,840億個のパラメータを持つMixture-of-Expertsモデルであり、トークンごとに約130億個のパラメータをアクティブ化し、100万トークンのコンテキストウィンドウと組み合わされています。リリースに伴って公開されたモデルカードによると、今回の改善は完全に再度のポストトレーニングによるものです。つまり、エンジニアはモデルの基本構造やサイズを変更することなく、複数ステップのタスクに対するフィードバックからモデルが学習する方法を洗練させました。このアプローチは、単にパラメータ数を増やすのではなく、よりスマートな学習技術によって既存のモデルアーキテクチャからより多くの能力を引き出すという、業界全体の幅広いトレンドを反映しています。
ベンチマークのハイライト
最も注目すべき結果は、エージェントおよびソフトウェアエンジニアリングの評価から得られました。コマンドライン環境をどの程度うまく操作できるかを測定するベンチマークであるTerminal-Bench 2.1において、V4-Flash-0731は82.7を記録し、V4-Pro-Previewの72.1を上回り、元のFlash Previewビルドの61.8から大幅に向上しました。コーディングベンチマークのDeepSWEでは、新しいビルドが54.4のスコアに達し、以前のバージョンの7.3から向上しました。研究者はこれを、同じモデルサイズで達成した645%の向上と説明しており、適切に設計された学習パイプラインがいかに多くの余地を解放できるかを強調しています。
学習の仕組み
今回のリリースを担当したエンジニアによると、コーディングおよびエージェント能力の向上は、検証可能な報酬を用いた強化学習に基づいています。具体的には、モデルがサンドボックス環境内で複数ステップのコーディングタスクを試み、生成されたコードがテストスイートに対して実行され、結果が合格か不合格かとして採点されます。この二値の真実信号がその後、成功した結果につながった一連のアクションを強化するために使用され、モデルをより信頼性の高い複数ステップの問題解決へと徐々に導きます。この学習スタイルは、単一ターンのテキスト生成ではなく、自律的かつ複数ステップのソフトウェアタスクが可能なAIシステムの構築において一般的になりつつあります。
APIおよび開発者向けアクセス
モデルの更新に伴い、DeepSeekはResponses API形式のネイティブサポートを導入しました。この構造は会話型およびツール利用アプリケーションを構築する開発者の間で人気を集めており、Codexスタイルのコーディングアシスタントとの互換性も確認されています。インフラストラクチャ面に関して、同社はV4-Flashエンドポイントが約2,500の同時リクエストを処理できると述べています。これは、より大容量のV4-Pro階層の約500と比較すると、顧客向けのコーディングアシスタントや自動化されたデータパイプラインなどの高スループットなアプリケーションにおいて、Flashをより魅力的な選択肢にしています。APIアクセスの料金は低コスト階層のままであり、入力トークン100万個あたり約0.14ドル、出力トークン100万個あたり約0.28ドルで公開されています。アナリストは、これにより大規模またはレイテンシに敏感なワークロードを実行する開発者にとって魅力的なモデルであり続けると指摘しています。
世界のAIコミュニティにとっての意義
今回のリリースは、学習方法が優先される場合、より小さく効率的なモデルが実用的なタスク指向ベンチマークでより大きなフラッグシップシステムに匹敵するか、それを超えることができるという証拠が積み重なっていることを裏付けるものです。世界中の学生、研究者、個人開発者にとって、このトレンドは重要な意味を持ちます。自律的にコードを記述、テスト、反復できるエージェント型AIシステムを実験するための計算およびコストの壁を下げるからです。教育者やテクノロジーコメンテーターは、このようなリリースを、検証可能な報酬を用いた強化学習が、単に文中の次の単語を予測するのではなく、現実世界の複数ステップタスク向けに大規模言語モデルを学習させる方法をどのように再構築しているかを示す有用な事例として挙げています。
今後の展望
業界の観測筋は、DeepSeekが自社のモデルファミリー全体でこの再度のポストトレーニングというアプローチの反復を続け、将来的なフラッグシップリリースに類似の技術を適用する可能性があると予想しています。同社は次の主要なアーキテクチャ更新に向けた具体的なタイムラインを発表していませんが、V4-Flash-0731のリリースは、2026年の残り期間においても段階的な学習の改善が同社の開発戦略の中核であり続けることを示唆しています。