ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

GLM-5.3 技术测评:后训练 Scaling 极限,编程能力提升 50%

GLM-5.3 技术测评:后训练 Scaling 极限,编程能力提升 50%

时效性提示:GLM-5.3 于 2026-08-14 正式发布。本文基于官方文档 + 发布会报道整理,引用的 benchmark 数据为智谱官方口径,引用前请复核。

发布概况

2026 年 8 月 14 日,智谱 AI 正式发布新一代旗舰基座模型GLM-5.3

  • 核心卖点:编程能力最强的开源模型,编程体感较前代提升50%,编程与智能体能力接近 Claude Fable 5
  • 关键事实:与 GLM-5.2使用完全相同的基座(总参数约7430 亿),性能提升全部来自极致的后训练 Scaling
  • 即日上线智谱官方编程工具ZCode、效率工具AutoClaw,及GLM Coding Plan全量用户

核心技术

参数规格

项目规格
总参数约 7430 亿(与 GLM-5.2 相同基座)
输入模态文本
输出模态文本
上下文窗口1M(100 万 token)
最大输出 Tokens128K
支持能力思考模式 / 流式输出 / Function Calling / 上下文缓存 / 结构化输出(JSON) / MCP

后训练 Scaling(本轮最大看点)

GLM-5.3 证明:不改基座,靠后训练硬拉性能

  • 训练基于IndexShare、SAO 及新一代 Slime 框架,在与 GLM-5.2 完全相同的基座上推进强化学习
  • 数十倍规模的长程任务环境、更丰富多样的环境类型、超长的后训练周期
  • 训练不再局限于孤立编程题,而是扩展至"发现问题 → 分析方案 → 实施 → 验证 → 交付"完整流程
  • 部分训练任务工作量相当于资深工程师连续数天的工作,模型需使用真实的计算集群、存储系统、内部文档与代码库完成任务
  • 智谱称基座的智能上限"远未开发完全"

基准成绩

编程与智能体能力(较前代提升 50%)

基准GLM-5.2GLM-5.3说明
Terminal-Bench 3.04.628.3开源第一
DeepSWE v1.146.266.9长程软件工程,开源第一
Agents’ Last Exam (CLI)23.828.5开源第一
GDPval-AA v21769覆盖 44 种职业

  • 编程与智能体能力接近 Claude Fable 5,实际编程体感领先其他国产模型
  • Kimi K3在编程/智能体领域互有胜负
  • 在绝大多数基准上领先 DeepSeek-V4-Pro-0813

Token 效率(Z.ai Code Bench)

  • 智谱自研 Z.ai Code Bench 的High 档位准确率 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%
  • 每项任务平均输出约5 万 tokens,远低于 Opus 4.8 的约12 万 tokens
  • 能以更短执行路径完成任务 → 更快、更省

网络安全能力(后训练"涌现")

基准GLM-5.2GLM-5.3对比
CyberGym77.2%84.5%高于 Mythos 5 (83.8%) / GPT-5.6 Sol (83.6%)
ExploitBench24.4%54.4%涨幅超一倍
  • 在白盒代码审查、漏洞发现与验证任务中表现接近 Mythos 5
  • 已与国内安全团队合作:在269 个项目中识别2436 个漏洞(中高危 1097 个),覆盖系统内核、操作系统、浏览器引擎等领域
  • 智谱自述:当前优势集中在漏洞利用链前端,更深入的漏洞利用与完整攻防仍有提升空间

实测能力

  • 复杂项目交付:能接住数万行代码、上百个文件、多个相互依赖系统的长期工程目标,极少人工干预下自主开发、反复验证到可交付状态
  • 实测案例:从 0 到 1 开发 3D 开放世界驾驶游戏;"裸考"读懂超 7000 个文件的代码仓库

产品落地

  • ZCode(官方编程工具)、AutoClaw(效率工具)即日上线
  • GLM Coding Plan全量用户可用(发布当天重置额度)
  • 第三方平台抢先体验:Trae / 扣子(Coze) / WorkBuddy / CodeBuddy / Qoder / CatPaw / JoyCode / OpenCode 等
  • 同步推出"开源的盾"计划:为核心开源项目提供免费持续安全审计,代码审计能力集成进 ZCode

评价与展望

  • 行业意义:证明后训练 Scaling 的巨大潜力——同基座、性能跃迁,为"基座不变、后训练迭代"路线背书
  • 开源地位:多项主流基准开源第一,整体逼近海外顶尖闭源模型(Fable 5 / Mythos 5)
  • 待验证:benchmark 为智谱官方口径,需第三方复测
  • 落地看点:编程 + 安全双能力走强,配合 Coding Plan 商业化,是"开源模型 + 编程入口"打法

参考来源

  • 智谱官方文档:docs.bigmodel.cn GLM-5.3 模型页
  • IT 之家 / 澎湃 / 中国站长网 / 品玩 / 网易 发布会报道
返回列表