首頁 / 資訊 / Z.ai 的 GLM-5.3 程式碼能力提升 50%,登頂開放權重基準測試
GLM-5.3

Z.ai 的 GLM-5.3 程式碼能力提升 50%,登頂開放權重基準測試

2026年8月14日4 分鐘閱讀
Z.ai 的 GLM-5.3 程式碼能力提升 50%,登頂開放權重基準測試

新聞摘要

總部位於北京的 AI 實驗室 Z.ai(智譜 AI)於 2026 年 8 月 14 日(北京時間)正式推出 GLM-5.3,將其定位為迄今為止最強大的開放權重程式碼與代理系統。此次發布沿用與 GLM-5.2 相同的基礎架構,所有能力提升皆來自大幅擴充的後訓練階段,而非更大的基礎模型。Z.ai 將此策略稱為「後訓練擴展」,意指無需從頭重新訓練,即可推升模型的智慧上限。

可用性與推出時程

GLM-5.3 即日起透過 Z.ai API 及 GLM Coding Plan 上線,並已於 2026 年 8 月 14 日(北京時間)公告時同步推送給所有現有程式碼方案訂閱用戶。開放模型權重目前尚未公開。Z.ai 表示,計劃在完成額外的安全評估與強化後,於大約兩週後、即 2026 年 8 月底(北京時間)左右釋出權重。在 API 方面,GLM-5.3 新增三種可選的思考強度等級——低、高與最高;此外,與先前版本不同的是,開發者無法再完全停用模型的推理步驟。Z.ai 指出,對於依賴即時非推理回應的應用程式而言,此項變更屬於破壞性更新。

程式碼與代理基準測試表現

Z.ai 報告指出,在其內部的 Z.ai Code Bench 測試中,GLM-5.3 的程式碼能力較 GLM-5.2 躍升約 50%,使該模型在多項公開評測中位居開放權重系統之首。公布的基準測試進步包括:Terminal-Bench 3.0 從 4.6 升至 28.3,DeepSWE v1.1 從 46.2 攀升至 66.9,Agents' Last Exam CLI 則從 23.8 提升至 28.5。在內部 Code Bench 測試中,GLM-5.3 使用約 50,000 個 token 進行推理,得分為 31.4%,優於 Claude Opus 使用 120,000 個 token 取得的 29.5%,但在同一基準測試中仍落後於頂尖的專有系統。作為競爭定位的一部分,Z.ai 也將此次發布的版本與 GPT-5.6 Sol、DeepSeek-V4 Pro 以及 Moonshot 的 Kimi K3 進行了比較。技術上的提升歸功於多項因素的結合:長上下文處理機制(命名為 IndexShare)、該公司稱為 SAO 的強化學習技術,以及其「slime」訓練框架;這些技術皆建構於更龐大且更多樣化的長期訓練環境之上,而該環境係模擬專業工程工作流程所打造。

網路安全能力成長超乎預期

Z.ai 發布說明中的一個顯著發現是,GLM-5.3 的攻擊性安全能力擴展速度,快於作為訓練主要目標的程式碼能力提升幅度。在 CyberGym 測試中,該模型得分為 84.5%,高於 GLM-5.2 的 77.2%;而在 ExploitBench 測試中,其分數更是翻倍以上,從 24.4% 增至 54.4%。在限時漏洞利用開發測試中,GLM-5.3 在两小時內完成了 105 項任務,六小時內完成 130 項,相比之下其前代模型僅分別完成 29 項與 39 項。Z.ai 表示,自 GLM-5.2 發布以來,已在內部使用該模型於 269 個開源專案中找出 2,436 個漏洞,其中 1,097 個被評為嚴重或高危等級。在發布時,已有 53 項發現獲分配公開的 CVE 識別碼,其餘 2,383 項則處於負責任揭露的保密期內,等待通知維護人員。Z.ai 將延遲發布模型權重的決定直接歸因於此項發現,並聲明必須先進行額外的安全強化,才能公開底層權重,否則這些權重可能被用於在 Z.ai 受監控的 API 之外複製該模型的攻擊能力。

產業背景

此次發布正值中國 AI 開發商競爭白熱化之際,各方力圖在程式碼與代理任務上縮小與西方頂尖實驗室的差距;此前數月,智譜及其競爭對手已接連推出快速迭代版本。國內媒體對此發布的報導,包括新浪科技和東方財富等 outlet,皆將 GLM-5.3 視為開源程式碼模型的重要里程碑,並指出儘管其仍落後於 Anthropic 和 OpenAI 最新的尖端發布版本,但其程式碼與代理效能已逼近頂級專有系統的水準。發布前的社群討論也聚焦於對原生多模態與視覺支援的需求,但 GLM-5.3 在此次發布中並未引入該功能。

GLM-5.3Z.ai