8 月 14 号,智谱发了 GLM-5.3。官方通稿里有一句话,我反复看了好几遍:基座模型没变。
对,就是和 GLM-5.2 完全一样的基座。所有提升,全部来自后训练。
这事放两年前不太好想象。那会儿大家的注意力都在预训练上,版本迭代的逻辑是换发动机——模型更大、语料更多、集群更贵。现在智谱告诉你,发动机不换,靠调校,成绩一样能刷上去一截。
而且刷得不少。编程能力内部体感评测提升 50%;Terminal Bench 3.0 从 4.6 干到 28.3,六倍;DeepSWE v1.1 从 46.2 到 66.9;Agents’ Last Exam 从 23.8 到 28.5。这几个评测测的不是选择题,是模型在真实终端里干活:读代码、跑命令、改文件、调工具。智谱说 GLM-5.3 的编程和智能体能力已经接近 Claude Fable 5,编程体感超过其他国产模型。
我真正想说的是另一个数。Z.ai Code Bench 上,GLM-5.3 在 High 档位准确率 31.4%,超过 Claude Opus 4.8 最高档的 29.5%;但平均每个任务只花约 5 万 tokens,Opus 4.8 要 12 万。
同样的活,一半不到的路径走完。这个比跑分数字实在多了。token 少就是钱少、就是快、就是不容易超时。自己跑过 Agent 流水线的人应该都懂那种痛:模型啥都会,就是爱绕路。
为什么都押在编程上
看看这一波的开源模型,火力点出奇一致。DeepSeek V4 Pro 的后训练全砸在 Agent 能力上(上篇写过),智谱的 GLM-5.3 也全砸在编程和终端任务上。原因不难想:编程是 Agent 时代最可验证、最能变现的场景。写没写对,编译和测试说了算,不需要人当裁判。
价格也卷起来了。GLM Coding Plan 回归订阅,透明积分制,118 元一个月起。隔壁 DeepSeek V4 Pro 输出价 6 元每百万 tokens,涨价公告还挂在定价页上。开源模型这一侧,编程工具链已经打到白菜价。
还有个细节值得单独说:GLM-5.3 的权重不是立刻放,要等两周,先做安全评估和模型加固。原因是它的网络安全能力——白盒代码审查、漏洞发现,已经持平 Mythos 5。能防也能攻,这种东西开源出去就是双刃剑。以后”最强开源模型”的发布节奏,恐怕都得先过这一关。
智谱在赌什么
把公司层面的消息串起来看更有意思。彭博 7 月报道,智谱建成了一座 1 吉瓦的数据中心,全部用国产芯片,已经部分运营。晚点 8 月 10 日消息,智谱 API 用户接近 700 万,一个多月涨了约 200 万,ZCode 上线一个月用户破百万,ARR 传闻 20 亿美元(官方否认,说实际更高)。
开源权重、编程订阅、国产算力,三样东西绑在一起,赌的是一个自主可控的开源生态。在中国,这个组合的想象空间比单纯的技术领先大得多。
我的看法
GLM-5.3 让我在意的不是”开源最强编程模型”这个头衔,而是它证明了另一件事:预训练的红利见顶之后,后训练还能把同一个基座的智能上界再顶高一截。
那问题就来了。如果竞争的主战场从预训练转移到后训练,下一轮的门槛是什么?RL 环境的规模和质量?做任务的数据飞轮?还是几万张国产卡?我说不准。但有一件事挺确定:那个”换个更大基座就能赢”的时代,过去了。
参考来源:
- 智谱正式发布 GLM-5.3(IT之家,2026-08-14):https://www.ithome.com/0/989/689.htm
- 消息称智谱 API 用户接近 700 万(IT之家/晚点 LatePost,2026-08-10):https://www.ithome.com/0/988/048.htm
- 消息称智谱建成大型 AI 数据中心(IT之家/凤凰科技,2026-07-21):https://www.ithome.com/0/979/301.htm
- 智谱 GLM Coding Plan 订阅回归(IT之家,2026-07-31):https://www.ithome.com/0/983/934.htm
- DeepSeek V4 Pro 正式版 API 更新上线(IT之家,2026-08-13):https://www.ithome.com/0/989/000.htm