首页 / 资讯 / 阿联酋MBZUAI与G42推出K2-Think:以320亿参数重新定义AI推理效率新标准
MBZUAI

阿联酋MBZUAI与G42推出K2-Think:以320亿参数重新定义AI推理效率新标准

2025年9月14日1 分钟阅读
阿联酋MBZUAI与G42推出K2-Think:以320亿参数重新定义AI推理效率新标准

摘要

阿联酋穆罕默德·本·扎耶德人工智能大学(MBZUAI)基础模型研究所与G42公司于9月9日联合发布了开源AI推理系统K2-Think。该模型仅使用320亿参数,却在数学、代码和科学推理方面的表现可媲美参数量多达20倍的大型模型。在多个数学基准测试中,K2-Think在AIME 2024上得分90.8分,AIME 2025上得分81.2分,HMMT 2025上得分73.8分,在Cerebras硬件上推理速度可达每秒2000个token。

技术突破:小模型大能力

K2-Think采用六大技术支柱构建,包括长链式思维监督微调、可验证奖励强化学习、智能体规划、测试时扩展、投机解码和推理优化硬件。与传统的"更大即更好"理念不同,K2-Think证明了通过智能设计可以实现参数效率的显著突破。

该系统基于Qwen2.5基础模型构建,通过先进的后训练和测试时计算技术,使较小模型能够在最高水平上竞争。在训练过程中,模型在数学基准测试上的表现在训练初期三分之一阶段(约0.5个epoch)内快速提升,AIME 2024达到79.3%通过率,AIME 2025达到72.1%通过率。

性能表现亮眼

K2-Think在多个领域展现出卓越性能:

  • 数学推理:在OMNI-MATH-HARD上得分60.7分,在所有开源模型的数学基准测试中领先
  • 代码生成:在LiveCodeBench v5上得分64.0分
  • 科学推理:在GPQA-Diamond上得分71.1分

真正的开源透明

与许多仅发布模型权重的"开源"AI模型不同,K2-Think实现了完全开源,包括训练数据、参数权重、部署软件代码和测试时优化技术。这种透明度确保模型学习推理的每一步都可以被全球研究社区研究、复现和扩展。

超高速推理能力

K2-Think在Cerebras晶圆级推理优化计算平台上可实现每秒2000个token的前所未有吞吐量。相比之下,Google的Gemini 2.5 Flash在第三方AI性能测量网站Artificial Analysis上的表现为每秒258个token,远低于K2-Think的速度。

领导层表态

MBZUAI董事会主席、人工智能与先进技术委员会成员哈勒敦·哈利法·阿穆巴拉克阁下表示:"K2-Think设立的新全球基准突显了MBZUAI基础模型研究所倡议的开创性卓越,这是全球合作和前沿研究的快速通道"。

G42集团首席执行官彭晓表示:"K2-Think已将AI推理范式从'更大即更好'转变为'更智能即更好'"。

MBZUAI校长兼大学教授Eric Xing表示:"K2-Think是全球AI研究开发社区的重大进步。通过在完全透明的框架内提供这些进步,我们正在开创一个成本效益高、可复现和负责任的AI新时代"。

模型族谱与未来展望

K2-Think建立在不断增长的阿联酋开发的开源模型家族基础之上,包括Jais(世界最先进的阿拉伯语LLM)、NANDA(印地语)和SHERKALA(哈萨克语),并延续了2024年发布的世界首个完全可复现开源基础模型K2-65B的开创性遗产。

该模型目前可在https://www.k2think.ai/ 和Hugging Face平台上获取。MBZUAI计划基于K2-Think配方构建未来模型,包括医疗保健和基因组学的适配版本。

技术规格

  • 参数规模:320亿参数
  • 基础模型:Qwen2.5-32B
  • 许可证:Apache 2.0
  • 推理速度:最高每秒2000个token(Cerebras硬件)
  • 部署平台k2think.ai、Hugging Face

总结

这一发布标志着阿联酋在全球AI领域的重要里程碑,展现了通过智能工程设计而非仅依赖计算规模来实现AI突破的新路径。

MBZUAI