科技·商业·财经

智谱GLM-5.3正式发布:后训练Scaling赋能,编程等多领域能力显著跃升

   时间:2026-08-14 22:56 作者:钟景轩

智谱今日宣布推出新一代开源模型 GLM-5.3,在保持基座模型不变的前提下,通过后训练 Scaling 技术显著提升了模型性能。该模型在编程能力、网络安全防御及复杂任务处理等方面实现突破,多项基准测试成绩超越前代及同类开源模型。

在编程能力方面,GLM-5.3 展现显著优势。内部评测显示其编程能力较 GLM-5.2 提升 50%,在 Terminal Bench 3.0 和 Agents' Last Exam (CLI) 等公开基准测试中位居开源模型首位。实际测试中,该模型在真实开发环境下的任务完成效率尤为突出:在 High 档位下准确率达 31.4%,超越 Claude Opus 4.8 最高档位的 29.5%,且每项任务平均输出 5 万 tokens,仅为后者 12 万 token 用量的 42%。

网络安全领域,GLM-5.3 在白盒代码审查和漏洞发现任务中表现与 Mythos 5 持平,证明其具备专业级安全防御能力。这得益于智谱开发的 IndexShare、SAO 及新一代 Slime 框架,通过强化学习在相同基座上实现了性能跃升。测试数据显示,在 DeepSWE v1.1 长程软件工程测试中,模型得分从 46.2 提升至 66.9;在覆盖 44 种职业的 GDPval-AA v2 测试中取得 1,769 分,展现出跨领域专业任务执行能力。

为验证模型实际使用体验,智谱自研 Z.ai Code Bench 评估体系将模型置于复杂本地开发环境,模拟开发者使用 Coding Agent 的真实场景。测试表明,GLM-5.3 在效果与资源利用率间取得平衡,其端到端任务执行路径较同类模型缩短 60% 以上。

伴随模型发布,智谱同步推出官方编程工具 ZCode 和效率工具 AutoClaw,GLM Coding Plan 用户额度今日 13:00 重置。TraeWork、WorkBuddy、Qoder 等十余个编码平台开放抢先体验,API 服务即将上线。完整模型权重将在完成安全加固后于两周内开源,通过限制潜在攻击能力确保其防御价值。

在跨工具协作测试 Agents' Last Exam 中,GLM-5.3 得分从 23.8 提升至 28.5,证明其长程任务处理能力显著增强。该模型在 Terminal-Bench 3.0 的得分跃升至 28.3,较前代 4.6 分增长 515%,成为当前开源模型中复杂终端任务处理能力最强的解决方案。

 
 
更多>同类内容
全站最新
热门内容