首页 / 资讯 / Grok 4.5 来了:xAI 经 Cursor 训练的模型挑战性价比曲线
xAI

Grok 4.5 来了:xAI 经 Cursor 训练的模型挑战性价比曲线

2026年7月9日1 分钟阅读
Grok 4.5 来了:xAI 经 Cursor 训练的模型挑战性价比曲线

新闻摘要

xAI 正式发布了其迄今为止最强大的模型 Grok 4.5,标志着该公司在大型语言模型开发前沿竞争方面迈出了重要一步。该版本于 2026 年 7 月 8 日(太平洋时间)发布,将 Grok 4.5 定位为“Opus 级”系统。xAI 创始人埃隆·马斯克表示,与同类前沿模型相比,Grok 4.5 更快、更具代币效率,同时价格也更低。

可用性和访问

Grok 4.5 即日起可通过 Grok Build、Cursor 编码编辑器的所有计划以及 xAI 开发者控制台获得。该模型正在全球范围内推出,但目前尚未通过 xAI 产品或 API 控制台在欧盟地区提供;预计在区域审查通过后,将于 2026 年 7 月中旬(中欧时间)在欧盟地区可用。

技术基础

新模型基于一个内部称为 V9 的 1.5 万亿参数基础。训练在数万个 NVIDIA GB300 GPU 上进行,xAI 工程师开发了新的稳定性和优化技术来支持如此大规模的运行。值得注意的是,Grok 4.5 是与 Cursor 紧密合作训练的,Cursor 是一个由 xAI 于 2026 年 6 月同意收购的人工智能辅助编码平台,交易价值 600 亿美元。Cursor 的真实开发者会话数据——包括调试跟踪、多文件代码差异和用户纠正模式——被整合到训练管道中,使模型在实际软件工程工作流程中具有实际基础。

功能和演示

xAI 通过演示突出了该模型在编码和代理推理方面的能力,例如仅凭一条自然语言指令即可生成一个完整的交互式 Three.js 太阳系模拟,包括可调节的时间控件和风格化的抬头显示器。该公司表示,Grok 4.5 在涵盖编码、科学、工程和数学的广泛数据混合上进行了训练,使其能够更连贯地处理复杂的多步技术任务。

基准性能

根据 xAI 公布的基准测试,Grok 4.5 在四项已披露的评估中的两项——DeepSWE 1.0 和 Terminal-Bench 2.1——上优于同类前沿模型,而在 DeepSWE 1.1 和 SWE-Bench Pro 上则以微弱劣势落后。SWE-Bench Pro 的一项突出效率结果显示,Grok 4.5 在解决任务时平均仅使用了约 15,954 个输出代币,而领先的竞争模型在同一基准测试中使用了约 67,020 个代币,这表明在推理密集型编码任务中具有显著的效率优势。该模型还在 Harvey 的法律代理基准测试中排名第一,这对于一个主要以软件工程为营销重点的模型来说是一个显著的成果,表明其训练方法能够很好地泛化到编码任务之外。

定价和性能

xAI 为 Grok 4.5 定价为每百万输入代币 2 美元,每百万输出代币 6 美元,低于几款竞争性前沿模型。该模型具有可配置的推理努力设置——低、中或高,默认设置为高——并以大约每秒 80 个代币的速度生成输出。Grok 4.5 也已成为 xAI 的应用程序构建环境 Grok Build 中的默认模型。

行业背景

此次发布正值前沿人工智能实验室之间竞争日益激烈之际,它们都在努力推出能够平衡原始能力与成本效益的模型,特别是对于运行大规模代理和编码工作负载的开发人员和企业而言。通过紧密整合广泛使用的编码工具的训练数据,xAI 将 Grok 4.5 定位为技术团队实用且了解工作流程的选择,而不是一个纯粹由基准驱动的发布。

xAIAI 模型