首頁 / 資訊 / 阿聯酋MBZUAI與G42推出K2-Think:以320億參數重新定義AI推理效率新標準
MBZUAI

阿聯酋MBZUAI與G42推出K2-Think:以320億參數重新定義AI推理效率新標準

Sep 14, 20251 分鐘閱讀
阿聯酋MBZUAI與G42推出K2-Think:以320億參數重新定義AI推理效率新標準

摘要

阿聯酋穆罕默德·本·扎耶德人工智慧大學(MBZUAI)基礎模型研究所與G42公司於9月9日聯合發布了開源AI推理系統K2-Think。該模型僅使用320億參數,卻在數學、程式碼和科學推理方面的表現可媲美參數量多達20倍的大型模型。在多個數學基準測試中,K2-Think在AIME 2024上得分90.8分,AIME 2025上得分81.2分,HMMT 2025上得分73.8分,在Cerebras硬體上推理速度可達每秒2000個token。

技術突破:小模型大能力

K2-Think採用六大技術支柱建構,包括長鏈式思維監督微調、可驗證獎勵強化學習、智能體規劃、測試時擴展、投機解碼和推理優化硬體。與傳統的「更大即更好」理念不同,K2-Think證明了透過智能設計可以實現參數效率的顯著突破。

該系統基於Qwen2.5基礎模型建構,透過先進的後訓練和測試時計算技術,使較小模型能夠在最高水平上競爭。在訓練過程中,模型在數學基準測試上的表現在訓練初期三分之一階段(約0.5個epoch)內快速提升,AIME 2024達到79.3%通過率,AIME 2025達到72.1%通過率。

性能表現亮眼

K2-Think在多個領域展現出卓越性能:

  • 數學推理:在OMNI-MATH-HARD上得分60.7分,在所有開源模型的數學基準測試中領先
  • 程式碼生成:在LiveCodeBench v5上得分64.0分
  • 科學推理:在GPQA-Diamond上得分71.1分

真正的開源透明

與許多僅發布模型權重的「開源」AI模型不同,K2-Think實現了完全開源,包括訓練數據、參數權重、部署軟體程式碼和測試時優化技術。這種透明度確保模型學習推理的每一步都可以被全球研究社群研究、重現和擴展。

超高速推理能力

K2-Think在Cerebras晶圓級推理優化計算平台上可實現每秒2000個token的前所未有吞吐量。相比之下,Google的Gemini 2.5 Flash在第三方AI性能測量網站Artificial Analysis上的表現為每秒258個token,遠低於K2-Think的速度。

領導層表態

MBZUAI董事會主席、人工智慧與先進技術委員會成員哈勒敦·哈利法·阿穆巴拉克閣下表示:「K2-Think設立的新全球基準突顯了MBZUAI基礎模型研究所倡議的開創性卓越,這是全球合作和前沿研究的快速通道」。

G42集團首席執行官彭曉表示:「K2-Think已將AI推理範式從『更大即更好』轉變為『更智能即更好』」。

MBZUAI校長兼大學教授Eric Xing表示:「K2-Think是全球AI研究開發社群的重大進步。透過在完全透明的框架內提供這些進步,我們正在開創一個成本效益高、可重現和負責任的AI新時代」。

模型族譜與未來展望

K2-Think建立在不斷增長的阿聯酋開發的開源模型家族基礎之上,包括Jais(世界最先進的阿拉伯語LLM)、NANDA(印地語)和SHERKALA(哈薩克語),並延續了2024年發布的世界首個完全可重現開源基礎模型K2-65B的開創性遺產。

該模型目前可在https://www.k2think.ai/ 和Hugging Face平台上獲取。MBZUAI計畫基於K2-Think配方建構未來模型,包括醫療保健和基因組學的適配版本。

技術規格

  • 參數規模:320億參數
  • 基礎模型:Qwen2.5-32B
  • 許可證:Apache 2.0
  • 推理速度:最高每秒2000個token(Cerebras硬體)
  • 部署平台k2think.ai、Hugging Face

總結

這一發布標誌著阿聯酋在全球AI領域的重要里程碑,展現了透過智能工程設計而非僅依賴計算規模來實現AI突破的新路徑。

MBZUAI