发布日期:2026-08-14 | 数据来源:智谱 AI 官方公告 | 话题:GLM-5.3 · 智谱 AI · 开源大模型 · Agent 编程
GLM-5.3 于 2026 年 8 月 14 日中午正式发布,是智谱 AI GLM-5 系列的最新版本;与 GLM-5.2 的核心差异在于技术路线——基座模型参数量(约 7430 亿,MoE 架构)完全未变,所有能力提升来自后训练阶段的极致 Scaling:任务环境规模扩展数十倍、环境类型更丰富、后训练时长显著延长;整体性能较 GLM-5.2 提升约 50%,在 Z.ai Code Bench 高难度档以 31.4%(耗 ~5 万 token)超越 Claude Opus 4.8 的 29.5%(耗 ~12 万 token),DeepSWE v1.1 从 46.2 跃升至 66.9,Terminal-Bench 3.0 从 4.6 跃升至 28.3(开源第一);网络安全能力新增披露:CyberGym 以 84.5% 排第一(Mythos 5 为 83.8%),实际在 269 个项目中发现 2436 个漏洞;模型权重将在发布两周内开源(宽松许可证),API 同步上线,具体定价尚未公布。
这次更新了什么:不换基座,只炼后训
GLM-5.3 的技术决策与 DeepSeek V4 Pro 0813 版本思路高度一致:基座参数量保持不变,通过后训练阶段的系统性投入拉升能力上限。
智谱官方表述:「基座模型没变,但通过极致的后训练 Scaling 大大提高了模型的智能上界。」
后训练三个维度的扩展:
- 长程任务环境规模扩大数十倍(覆盖更长时间跨度的真实工程任务)
- 环境类型更丰富(从代码调试延伸到安全漏洞发现、系统工程等场景)
- 后训练时长显著增加(部分训练任务相当于"经验丰富工程师数天的工作量")
这种技术路线的意义在于:保持开源权重的持续性——基座不变,社区基于前代版本的微调和二次开发工作可以无缝延用底层结构。
编程能力:高难度超 Opus 4.8,最高难度仍落后 Fable 5
GLM-5.3 的官方编程基准以 Z.ai Code Bench(智谱自研内部评测)为核心,分两个难度档:
| 难度档 | GLM-5.2 | GLM-5.3 | 对比模型 |
|---|---|---|---|
| 最高难度完成率 | 23.4%(~9.6 万 token) | 34.5%(~7.5 万 token) | Fable 5:39.5% |
| 高难度完成率 | 未披露 | 31.4%(~5 万 token) | Claude Opus 4.8:29.5%(~12 万 token) |
高难度档:GLM-5.3 以 31.4% 超越 Claude Opus 4.8 的 29.5%,同时 token 消耗仅约 5 万,是 Opus 4.8 的 40%——以更少计算量完成更多任务。
最高难度档:34.5% vs Fable 5 的 39.5%,差距约 5 个百分点,仍未追上顶尖闭源模型。
第三方独立基准数据(vs GLM-5.2):
| 测试集 | GLM-5.2 | GLM-5.3 | 涨幅 |
|---|---|---|---|
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7pp |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7pp(开源第一) |
| Agents’ Last Exam | 23.8 | 28.5 | +4.7pp |
| GDPval-AA v2 | — | 1769 | — |
Terminal-Bench 3.0 的 28.3 分是开源模型当前最高分;DeepSWE v1.1 的 66.9 已超越同期 DeepSeek V4 Pro 的 62.7(官方数据)。
网络安全能力:CyberGym 全球第一
GLM-5.3 首次在正式发布中突出网络安全评测数据,并披露了实际漏洞发现成果:
基准测试:
| 测试集 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | 77.2% | 84.5%✓ | 83.8% | 83.6% |
| ExploitBench | 24.4% | 54.4% | 78.0%✓ | 73.5% |
| ExploitGym(2h 任务) | 29 | 105 | 181✓ | — |
| ExploitGym(6h 任务) | 39 | 130 | 247✓ | — |
CyberGym(网络安全知识与防御)排第一;ExploitBench 和 ExploitGym(漏洞发现与利用)仍落后于 Mythos 5,但提升幅度显著(ExploitBench 翻倍以上)。
实际应用成果:
- 联合国内安全团队,在 269 个真实开源项目中发现2436 个漏洞
- 其中中高危漏洞1097 个
- 部分漏洞存留时间约 40 年
- 已建立"智谱安全披露账本"公开记录
这是目前国内开源大模型中首次在正式发布场合大规模披露实际漏洞发现数据。
Token 效率:完成相同任务耗 5 万 vs 12 万
Token 效率是 GLM-5.3 的重要差异化指标:
| 场景 | 模型 | 完成率 | 平均 token 消耗 |
|---|---|---|---|
| Code Bench 高难度 | GLM-5.3 | 31.4% | ~5 万 |
| Code Bench 高难度 | Claude Opus 4.8 | 29.5% | ~12 万 |
完成率更高的同时,token 消耗约为对比模型的 40%。对于按 token 计费的 API 用量来说,这直接影响实际调用成本——即使 GLM-5.3 未来定价与 Opus 4.8 相当,实际单次任务成本也会因 token 效率差异而不同。
开源与 API 计划
| 项目 | 状态 |
|---|---|
| API | “很快上线”(截至 2026-08-14 具体时间未定) |
| 模型权重开源 | 两周内(完成安全评估后) |
| 开源许可证 | 宽松许可证(具体类型待确认) |
| GLM Coding Plan | 8 月 14 日 13:00 全员额度重置 |
GLM-5.2 此前采用 MIT 许可证,GLM-5.3 预计延续宽松许可模式。
参考:GLM-5.2 API 定价(GLM-5.3 定价待官方公布)
| 类型 | GLM-5.2 参考价 |
|---|---|
| 输入 | 约 ¥1.4/M tokens |
| 输出 | 约 ¥4.4/M tokens |
GLM-5.3 正式 API 定价以智谱 AI 开放平台(bigmodel.cn)官方公告为准。
竞品格局:DeepSeek 涨价窗口下的差异化策略
GLM-5.3 的发布时机在竞争格局上有其意义:
DeepSeek V4 Pro 于同一天(8 月 13 日)正式发布,官方同步预告"近期大幅涨价";GLM-5.3 在 DeepSeek 涨价窗口期内上线,且延续开源策略,在国内主流大模型中形成差异化定位。
同期主要模型数据参考:
| 模型 | DeepSWE v1.1 | Terminal-Bench | 是否开源 |
|---|---|---|---|
| GLM-5.3 | 66.9 | 28.3(开源第一) | 两周内 |
| DeepSeek V4 Pro | 62.7 | — | 否 |
| Gemini 3.7 Flash | — | 85.8 | 否 |
| Fable 5 | — | — | 否(参考档) |
DeepSWE v1.1 上,GLM-5.3 的 66.9 已超过 DeepSeek V4 Pro 的 62.7,但与闭源旗舰(Fable 5 等)仍有差距。
常见问题
Q:GLM-5.3 和 GLM-5.2 的模型 ID 是否不同?
智谱 API 历史上每个版本均有独立模型 ID(如glm-5、glm-5.2)。GLM-5.3 的具体 API 模型 ID 截至发布时尚未公布,预计随 API 上线一同披露,以 bigmodel.cn 开放文档为准。
Q:"两周内开源"为什么需要等待?
官方说明开源前需完成安全评估与模型加固,这是针对安全能力(漏洞发现/利用)的特殊预防措施——GLM-5.3 在 ExploitBench 上大幅提升,开放权重前需确保不被用于恶意漏洞利用场景。
Q:GLM-5.3 和 DeepSeek V4 Pro 同日发布,怎么选?
定位不同:GLM-5.3 开源(两周内),权重可私有化部署;DeepSeek V4 Pro 闭源 API 调用。编程 Agent 场景:GLM-5.3 DeepSWE 66.9 略高于 V4 Pro 的 62.7;长文本输出:V4 Pro 最大输出 384K,GLM-5.2 为 131K(GLM-5.3 待确认)。预算敏感团队或需要本地部署的场景,GLM-5.3 开源路线更灵活。
Q:Z.ai Code Bench 是公开测试集吗?
Z.ai Code Bench 是智谱自研内部评测集,非公开数据集,结果无法独立复现验证。第三方独立基准数据(DeepSWE、Terminal-Bench)来自公开评测框架,可作为更客观的参照。
Q:调用 GLM-5.3 API 同时也想接入 DeepSeek、Kimi 等多款模型怎么管理?
多款模型同时维护多套 API Key 和端点会带来运维成本。通过多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)可以统一端点管理多款国产主流大模型,模型切换只改model字段,不需要为每家分别维护鉴权配置。
小结
GLM-5.3 延续了"开源第一"的战略定位,用后训练 Scaling 而非架构升级实现了阶段性超越:高难度编程完成率超过 Claude Opus 4.8(同时 token 消耗仅约 40%),CyberGym 安全评测排名全球第一,DeepSWE 66.9 领先同期 DeepSeek V4 Pro;最高难度距 Fable 5 还有约 5 个百分点的差距。两周内开源的计划,叠加 DeepSeek 涨价背景,为需要开源模型的团队提供了节点选择窗口。
本文信息截至 2026 年 8 月 14 日,API 定价与模型 ID 以智谱 AI 开放平台(bigmodel.cn)正式公告为准。
延伸阅读
- 智谱 AI 开放平台(GLM-5 系列 API 接入):https://bigmodel.cn
- GLM-5 系列官方文档:https://docs.bigmodel.cn/cn/guide/models/text/glm-5
- GLM-5.2 开源地址(GitHub):https://github.com/zai-org/
- 七牛云 Token Plan(含 GLM 系列多模型统一接入):https://qiniu.com/ai/plan