首頁 / 資訊 / Grok 4.5 登場:xAI 經 Cursor 訓練的模型挑戰性價比曲線
xAI

Grok 4.5 登場:xAI 經 Cursor 訓練的模型挑戰性價比曲線

Jul 9, 20261 分鐘閱讀
Grok 4.5 登場:xAI 經 Cursor 訓練的模型挑戰性價比曲線

新聞摘要

xAI 正式發佈了其迄今為止功能最強大的模型 Grok 4.5,這標誌著該公司在大型語言模型開發前沿競爭方面邁出了重要一步。該版本於 2026 年 7 月 8 日(太平洋時間)發佈,將 Grok 4.5 定位為一個「Opus 級」系統。xAI 創始人 Elon Musk 表示,與同類前沿模型相比,Grok 4.5 的速度更快、代幣效率更高,同時價格也更低廉。

可用性和存取權

Grok 4.5 即日起可透過 Grok Build、Cursor 編碼編輯器的所有方案以及 xAI 開發者控制台使用。該模型正在全球推出,但目前尚未透過 xAI 產品或 API 控制台在歐洲聯盟使用;預計在經過區域審查後,於 2026 年 7 月中旬(中歐時間)在歐盟地區提供。

技術基礎

新模型建立在一個擁有 1.5 兆參數的基礎之上,內部代號為 V9。訓練過程使用了數萬個 NVIDIA GB300 GPU,xAI 工程師開發了新的穩定性和優化技術來支援如此大規模的運行。值得注意的是,Grok 4.5 的訓練與 Cursor 緊密合作完成,Cursor 是 xAI 在 2026 年 6 月同意收購的、價值 600 億美元的人工智慧輔助編碼平台。Cursor 的真實開發者會話數據,包括調試追蹤、多文件代碼差異以及用戶糾正模式,都被整合到訓練流程中,為模型提供了在真實軟體工程工作流程中的實用基礎。

功能和演示

xAI 強調了該模型在編碼和代理推理方面的能力,例如僅憑單一自然語言指令,即可生成一個完整的互動式 Three.js 太陽系模擬,包含可調節的時間控制和風格化的抬頭顯示器。該公司表示,Grok 4.5 在廣泛的數據集上進行了訓練,涵蓋編碼、科學、工程和數學領域,使其能夠更連貫地處理複雜的多步驟技術任務。

基準性能

根據 xAI 發布的基準測試,Grok 4.5 在四項已披露的評估中,有兩項(DeepSWE 1.0 和 Terminal-Bench 2.1)的表現優於同類前沿模型,而在 DeepSWE 1.1 和 SWE-Bench Pro 上則以微弱劣勢落後。SWE-Bench Pro 的一項突出效率結果顯示,Grok 4.5 在解決任務時平均僅使用了約 15,954 個輸出代幣,而領先的競爭模型在同一基準測試中使用了約 67,020 個代幣,這表明在推理密集型編碼任務中具有顯著的效率優勢。該模型還在 Harvey 的 Legal Agent Benchmark 中排名第一,這對於一個主要以軟體工程為賣點的模型來說是一個顯著的結果,表明其訓練方法能夠很好地泛化到編碼任務之外。

定價和性能

xAI 為 Grok 4.5 設定的價格為每百萬輸入代幣 2 美元,每百萬輸出代幣 6 美元,低於多個競爭前沿模型。該模型具有可配置的推理工作量設置——低、中或高,預設為高——並以大約每秒 80 個代幣的速度生成輸出。Grok 4.5 也已成為 xAI 的應用程式構建環境 Grok Build 中的預設模型。

行業背景

此次發布正值前沿人工智能實驗室之間競爭日益激烈之際,它們都在爭相推出能夠平衡原始能力與成本效益的模型,特別是針對運行大規模代理和編碼工作負載的開發者和企業。透過緊密整合廣泛使用的編碼工具的訓練數據,xAI 將 Grok 4.5 定位為技術團隊實用且具備工作流程意識的選擇,而非純粹以基準測試為導向的發布。

xAIAI 模型