GLM-5.3 发布:基座没变,能力却暴涨——智谱用「后训练 Scaling」走出了第三条路

8 月 14 日,智谱发了 GLM-5.3。唐杰之前预告的"史诗级 plus"终于露面。

但看完技术报告,最意外的不是成绩,而是做法:GLM-5.3 的基座模型没变。

参数规模和 GLM-5.2 基本一致(约 7530 亿),能力提升全部来自后训练——智谱管这叫"后训练 Scaling"。一句话解释:课本没变,但换了更好的训练方法,学生成绩就上去了。

在大家都在卷参数(Kimi K3 直接干到 2.8 万亿)、卷价格(DeepSeek 当价格屠夫)的时候,智谱选了第三条路。

编程能力:两个榜单翻了六倍和 45%

GLM-5.3 最硬的数据在编程。

衡量真实终端环境任务完成的 Terminal-Bench 3.0:4.6 分 → 28.3 分,翻了六倍,开源模型第一。

考察长程软件工程能力的 DeepSWE v1.1:46.2 → 66.9,开源第一。

智谱自研的 Z.ai Code Bench 更有意思:High 档位 31.4% 的准确率,超过了 Claude Opus 4.8 最高档的 29.5%——而且每任务平均只输出约 5 万 tokens,Opus 4.8 是它的两倍多。能力更强,还更省。

当然 Max 档位下 GLM-5.3(34.5%)还是低于 Fable 5(39.5%)——“比肩"是真的,但还没到"超越”。

安全能力:顺手抓了 2436 个漏洞

编程之外的第二条主线是网络安全。

国际漏洞推理评测 CyberGym:84.5%,超过 Anthropic 的 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。

更考验深度推理的 ExploitBench(要理解真实漏洞成因并完成利用验证):54.4%,是上一代 24.4% 的两倍多。

背后是真刀真枪的活:智谱联合清华、奇安信、腾讯玄武等十余家安全团队,对真实代码库做红队测试,累计在 269 个项目里识别出 2436 个漏洞,其中 1097 个中高危,覆盖系统内核、操作系统、浏览器引擎、互联网协议——部分威胁能让 Android、Windows、macOS 出现大范围崩溃。漏洞已陆续提交 CNNVD、CNVD 国家漏洞库。

这个数据对普通用户的意义:敢让 AI 写代码的前提,是 AI 自己先懂漏洞。

行业变局:海外降价,国产涨价

GLM-5.3 发布的时间点很微妙,正赶上全球大模型定价策略的剧烈转向。

海外在降价:8 月 4 日 OpenAI 把 GPT-5.6 Luna 的 API 价格下调约 80%(输入 $1 → $0.2);谷歌 Gemini 3.7 Flash 限时五折;Anthropic 的 Claude Opus 5 定价只有 Fable 5 的一半。集体降价的动因,正是 Kimi K3、DeepSeek V4 带来的冲击。

国产在涨价:DeepSeek V4-Pro 高峰时段输出价格从 6 元涨到 27 元;Kimi K3 输出定价 100 元,比上代涨了 2-3 倍。机构统计,中国大模型平均 API 输出价格已从 2025 年一季度的 12.2 元涨到 2026 年二季度的 21.9 元。

从"以性价比换市场"走向"价值变现"——GLM-5.3 正好卡在这个节点。行业分析:若沿用 GLM-5.2 的定价(输入 8 元、输出 28 元/百万 token),它和 DeepSeek V4-Pro 高峰期的 9 元/27 元基本打平。国产旗舰的价格带,正在往同一个方向收拢。

横向对比:一个月内,国产三巨头各自亮牌

过去一个月,国产三巨头正好完成一轮关键迭代,路线截然不同:

Kimi K3(7 月 16 日):卷参数。2.8 万亿参数、896 个专家激活 16 个,配 Kimi Delta Attention 架构,主攻编程、游戏/3D。输出定价 100 元/百万 token,第一次有国产模型直接站进美国旗舰的价位带(约等于 GPT-5.6 Terra 的定价)。未开源。

DeepSeek V4 Pro(8 月 13 日):卷价格。1.6 万亿参数,MIT 开源,主打极致性价比——虽然首发后因性能争议被撤回,但"价格屠夫"的路线没有变,高峰时段输出 27 元/百万 token。

GLM-5.3(8 月 14 日):卷后训练。7530 亿参数基座不变,靠后训练 Scaling 把编程和安全能力拉满,输出约 28 元/百万 token。

三个数字放在一起看很有意思:Kimi K3 输出 100 元、DeepSeek 高峰 27 元、GLM-5.3 约 28 元——除了 Kimi 坚定站旗舰价位,另外两家几乎打平。国产模型从"白菜价互卷"走向"旗舰价位收拢",这轮价格战的阶段已经翻篇了。

除了性能路线,三个模型的"供应能力"差别也很大——也就是模型怎么交付给你、你能不能拿到权重、API 稳不稳:

  1. 开源程度:DeepSeek V4 全系 MIT 开源权重,可以私有化部署,这是它最大的供应优势;GLM 系列有开源传统(5.2 就是 MIT 开源),5.3 是否同步开源还没公布,但智谱的路线一贯是"开源 + 开放平台"双轨;Kimi K3 目前未开源,只能走 API 和 Kimi Code,想私有化部署的团队可以直接排除。

  2. API 服务:三家都有官方 API(Kimi 平台、DeepSeek 开放平台、智谱 bigmodel/Z.ai),兼容 OpenAI SDK,工具链切换成本低。但 DeepSeek 刚经历了 V4-Pro 发布即撤回的事故——模型供应流程出了岔子,API 的模型指向也跟着变过。这件事提醒所有重度依赖方:旗舰模型的供应稳定性,本身就应该纳入选型评估。

  3. 安全与合规:智谱这次的红队数据(2436 个漏洞提交国家漏洞库)是国产模型里罕见的"供应方主动承担安全责任"的姿态;DeepSeek 主打开源透明;Kimi 的闭源路线在合规审计场景反而更简单(数据不出云)。

对开发者的实用建议:重度长上下文/游戏 3D 场景看 Kimi K3(缓存命中 2 元很香);预算敏感、要开源权重、要私有化部署看 DeepSeek;编程 + 安全合规场景可以重点试 GLM-5.3。

怎么理解这件事

过去一个月,国产三巨头各自亮牌:Kimi K3 卷参数(2.8 万亿)、DeepSeek 卷价格(V4-Flash 极致性价比)、智谱卷后训练(基座不变能力暴涨)。

三条路没有对错,但 GLM-5.3 这条路最值得观察——因为它回答了一个行业都想知道的问题:预训练的智能上界,到底还有多少没被挖出来? 智谱给出的答案是:远没到天花板。

对开发者来说,GLM-5.3 的编程能力和输出效率(同样的活,一半的 tokens)是实打实能省钱的;对安全从业者,那个 2436 个漏洞的红队数据,说明国产模型的安全能力已经从"能写代码"进化到"能审代码"。

当然也有悬念:后训练 Scaling 的红利还能挖多久、开源之后的安全管控扛不扛得住、以及在海外降价国产涨价的剪刀差里,智谱能不能用编程生态立住护城河。

你开始用 GLM-5.3 了吗?评论区聊聊。

0%