Z.ai 发布 GLM-5.3:编程能力跃升 50%,登顶开放权重基准测试

新闻摘要
总部位于北京的 AI 实验室 Z.ai(智谱AI)于2026年8月14日(北京时间)正式发布了 GLM-5.3,将其定位为迄今为止最强大的开放权重编程与智能体系统。此次发布沿用了与 GLM-5.2 相同的基座架构,所有能力提升均源于大幅扩展的后训练阶段,而非更大的基座模型。Z.ai 将这一策略称为“后训练缩放”,旨在不从头重新训练的前提下推高模型的智能上限。
可用性与部署计划
GLM-5.3 现已通过 Z.ai API 和 GLM Coding Plan 即时上线,并已于2026年8月14日(北京时间)公告发布时向所有现有编程套餐订阅用户推送。开放模型权重尚未公开。Z.ai 表示,计划在完成额外的安全评估与加固后,于大约两周后,即2026年8月底(北京时间)左右发布权重。在 API 层面,GLM-5.3 引入了三个可选的思考强度等级——低、高和最高;同时,与以往版本不同的是,开发者不再能完全禁用模型的推理步骤。Z.ai 将此标记为破坏性变更,可能会影响那些依赖即时、非推理响应的应用。
编程与智能体基准测试表现
Z.ai 报告称,在其内部 Z.ai Code Bench 测试中,GLM-5.3 的编程能力较 GLM-5.2 跃升约 50%,并在多项公开评测中位居开放权重系统榜首。公布的基准测试涨幅包括:Terminal-Bench 3.0 从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 攀升至 66.9,Agents' Last Exam CLI 从 23.8 提高至 28.5。在内部 Code Bench 上,GLM-5.3 使用约 50,000 个 token 进行推理,得分达到 31.4%,领先于 Claude Opus 在 120,000 个 token 下取得的 29.5%,尽管在同一基准上仍落后于前沿闭源系统。作为竞争定位的一部分,Z.ai 还将该版本与 GPT-5.6 Sol、DeepSeek-V4 Pro 以及 Moonshot 的 Kimi K3 进行了对比。技术上的进步归功于长上下文处理(称为 IndexShare)、公司称之为 SAO 的强化学习技术,以及其“slime”训练框架的综合运用,这些技术叠加在更大规模、更多样化的长期训练环境之上,而这些环境正是基于专业工程工作流建模而成的。
网络安全能力增长超预期
Z.ai 发布说明中的一个显著发现是,GLM-5.3 的进攻性安全能力扩展速度快于作为训练主要目标的编程能力。在 CyberGym 测试中,该模型得分达 84.5%,高于 GLM-5.2 的 77.2%;在 ExploitBench 上,其得分更是翻了一番以上,从 24.4% 升至 54.4%。在限时漏洞利用开发测试中,GLM-5.3 在两小时内完成了 105 项任务,六小时内完成了 130 项,而其前代产品分别为 29 项和 39 项。Z.ai 表示,自 GLM-5.2 发布以来,已在内部使用该模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个被评定为严重或高危。发布时,已有 53 个发现被分配了公开的 CVE 编号,其余 2,383 个仍处于负责任披露的保密期,等待通知维护者。Z.ai 将模型权重的延迟发布直接归因于此发现,指出在公开底层权重之前需要进行额外的安全加固,否则这些权重可能被用于在 Z.ai 受监控的 API 之外复制模型的进攻性能力。
行业背景
此次发布正值中国 AI 开发者竞争加剧之际,各方正努力缩小与西方领先实验室在编程和智能体任务上的差距,此前智谱及其竞争对手已连续数月进行快速迭代。包括新浪科技和东方财富在内的国内媒体在报道中将 GLM-5.3 视为开源编程模型的重要一步,指出其编程和智能体性能已接近顶级闭源系统,尽管仍落后于 Anthropic 和 OpenAI 最新的前沿版本。发布前的社区讨论也集中在对原生多模态和视觉支持的需求上,但 GLM-5.3 在此次发布中并未引入该功能。