アラブ首長国連邦MBZUAIとG42がK2-Thinkを発表:320億パラメータでAI推論効率の新たな基準を再定義

要約
アラブ首長国連邦のムハンマド・ビン・ザーイド人工知能大学(MBZUAI)基礎モデル研究所は、G42社と共同で、9月9日にオープンソースAI推論システム「K2-Think」を発表しました。このモデルはわずか320億のパラメータを使用しながらも、数学、コード、科学的推論において、最大20倍のパラメータを持つ大規模モデルに匹敵する性能を発揮します。複数の数学ベンチマークテストでは、K2-ThinkはAIME 2024で90.8点、AIME 2025で81.2点、HMMT 2025で73.8点を獲得し、Cerebrasハードウェア上での推論速度は1秒あたり2,000トークンに達します。
技術的ブレークスルー:小規模モデルの大きな能力
K2-Thinkは、長鎖思考監督ファインチューニング、検証可能な報酬強化学習、エージェントプランニング、テスト時拡張、投機的デコード、推論最適化ハードウェアという6つの主要な技術的柱に基づいて構築されています。従来の「より大きいほど優れている」という考え方とは異なり、K2-Thinkはインテリジェントな設計を通じて、パラメータ効率における顕著なブレークスルーを達成できることを証明しました。
このシステムはQwen2.5ベースモデルを基盤としており、高度な後学習およびテスト時計算技術を通じて、より小規模なモデルが最高レベルで競争することを可能にしています。学習プロセスにおいて、モデルは数学ベンチマークテストでの性能が学習初期の3分の1の段階(約0.5エポック)で急速に向上し、AIME 2024で79.3%の合格率、AIME 2025で72.1%の合格率を達成しました。
際立った性能
K2-Thinkは複数の分野で卓越した性能を発揮しています。
- 数学的推論:OMNI-MATH-HARDで60.7点を獲得し、すべてのオープンソースモデルの数学ベンチマークでトップの成績を収めています。
- コード生成:LiveCodeBench v5で64.0点を獲得しました。
- 科学的推論:GPQA-Diamondで71.1点を獲得しました。
真のオープンソースの透明性
モデルの重みのみを公開する多くの「オープンソース」AIモデルとは異なり、K2-Thinkは学習データ、パラメータの重み、デプロイ用ソフトウェアコード、およびテスト時最適化技術を含む完全なオープンソースを実現しています。この透明性により、モデルが推論を学習するあらゆるステップが、世界の研究コミュニティによって研究、再現、拡張されることが保証されます。
超高速推論能力
K2-Thinkは、Cerebrasのウェハーレベル推論最適化計算プラットフォーム上で、1秒あたり2,000トークンという前例のないスループットを実現します。対照的に、GoogleのGemini 2.5 Flashは、第三者AI性能測定サイトArtificial Analysisでの性能が1秒あたり258トークンであり、K2-Thinkの速度をはるかに下回っています。
リーダーシップからのコメント
MBZUAI理事会議長、人工知能・先端技術委員会メンバーであるハルドゥーン・ハリーファ・アル・ムバラク閣下は、「K2-Thinkが確立した新たな世界的なベンチマークは、MBZUAI基礎モデル研究所のイニシアチブにおける画期的な卓越性を際立たせており、これはグローバルな協力と最先端研究への迅速な道筋です」と述べました。
G42グループCEOの彭暁(Peng Xiao)は、「K2-Thinkは、AI推論のパラダイムを『より大きいほど優れている』から『より賢いほど優れている』へと転換させました」とコメントしました。
MBZUAI学長兼大学教授のエリック・シン(Eric Xing)は、「K2-Thinkは、世界のAI研究開発コミュニティにとって大きな進歩です。完全に透明なフレームワーク内でこれらの進歩を提供することで、私たちは費用対効果が高く、再現可能で、責任あるAIの新時代を切り開いています」と述べました。
モデルファミリーと将来の展望
K2-Thinkは、Jais(世界最先端のアラビア語LLM)、NANDA(ヒンディー語)、SHERKALA(カザフ語)を含む、成長を続けるUAE開発のオープンソースモデルファミリーを基盤としており、2024年に発表された世界初の完全に再現可能なオープンソース基盤モデルK2-65Bの画期的な遺産を受け継いでいます。
このモデルは現在、https://www.k2think.ai/ およびHugging Faceプラットフォームで利用可能です。MBZUAIは、K2-Thinkの手法に基づいて将来のモデルを構築する計画であり、ヘルスケアやゲノミクス向けの適応バージョンも含まれます。
技術仕様
- パラメータ数:320億パラメータ
- ベースモデル:Qwen2.5-32B
- ライセンス:Apache 2.0
- 推論速度:最大1秒あたり2,000トークン(Cerebrasハードウェア)
- デプロイプラットフォーム:k2think.ai、Hugging Face
まとめ
この発表は、グローバルなAI分野におけるUAEの重要なマイルストーンを示し、計算規模のみに依存するのではなく、インテリジェントなエンジニアリング設計を通じてAIのブレークスルーを達成する新たな道筋を示しています。