(本文作者为 字母 AI,钛媒体经授权发布)
文 | 字母 AI
智谱发布 GLM-5.1 的时候,盘中涨幅一度接近 19%,收盘涨幅 11.5%。到了 GLM-5.2,当天暴涨 32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3 发布后,智谱股价不得起飞喽?
可事与愿违,8 月 14 日发布 GLM-5.3 当天,智谱跌 3.57%,日内回撤超 11%。
智谱 GLM-5.3 的成绩单很亮眼。DeepSWE 的 66.9 分超过了 V4 Pro 的 62.7,Terminal Bench 3.0 从 5.2 的 4.6 分暴涨到 28.3 分拿下开源第一,CyberGym 以 84.5% 登顶全球,在高难度编程任务上,只用了不到 Claude Opus 4.8 一半的 token,就拿到了更高的完成率。
在智谱官方放出的性能图里,编程、终端操作、Agent 任务、网络安全等八方面,赢过了 DeepSeek V4 Pro 正式版七项,对 DeepSeek 形成了“ 精准狙击”。

但是却很少有人注意到,GLM-5.3 其实并非“ 新” 模型,它和 GLM-5.2 用的是同一个 7430 亿参数基座,所有提升全靠后训练。这和 DeepSeek V4 Pro 从预览版到正式版的逻辑是一样的,后者也都是同一个 1.6T 基座,能力跃迁同样来自后训练。
GLM-5.3 之于 5.2,就是 V4 Pro 正式版之于预览版。两者的不同在于,智谱没有涨价,DeepSeek 却涨了一大截。从 8 月 17 日 0 点开始,DeepSeek API 新一轮调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,全计费项涨幅区间为 50% 至 1100%。
还有一点,那就是在自进化这块,智谱已经和 DeepSeek 形成了初步交锋。GLM-5.3 的新后训练方法,本质上是一种模型自进化。而 DeepSeek V4 Pro 同步发布的 DeepSeek Harness,其插件即一切的策略,也是为了自进化。
自进化是公认通往 AGI 的赛道,眼下国产大模型的 AGI 赛道,本质上就是智谱、DeepSeek、Kimi 三家的竞速。 都喊着 AGI,都在拼谁的模型更像一个能独立干活的 "人"。
两家的方法论究竟有何不同?
先看智谱这边。GLM-5.2 到 5.3 最核心的变化是加入了一套“ 自己出真题自己做” 的环境合成流水线。
在 GLM-5.2 的时期,训练环境还主要靠人工搭建,所以题型有限、场景也偏模拟题。
到了 5.3,智谱引入了一个全自动的环境生成机制。
具体来讲,智谱用了一个“AI 研究员”(研究 Agent) 去真实场景里面抄题目。比如它会观察工程师到底怎么干活,把真活儿变成考题。
其实很早之前的生成对抗就采用了类似的逻辑,用机器给机器出题。
可机器出题没法保证每道题都是好题。 有的题可能根本解不出来 (出题时条件给错了),有的题可能缺关键信息 (做到一半卡死),有的题可能是“ 无解题”(mission impossible)。如果这些废题混进训练题库,模型辛辛苦苦刷了半天,刷的是一道根本做不出来的题。
因此智谱用了一个 AI 判卷员 (判断 Agent),先自己做一遍。 相当于出题人出完卷子,先自己答一遍,确认“ 这题真的能解出来”,不是道废题。防止出那种连老师都不会做、纯粹难为学生的怪题。
判卷员在做题过程中,不许看参考答案,只看解题过程。
如果是带着答案做题,那么模型可能学会“ 背答案” 或者“ 抄近路”。表面上得分高,实际啥也没学会。所以判卷员得盯着解题轨迹,看它是不是一步一个脚印真解出来的,有没有钻漏洞、走捷径。只有“ 题能出、能做、过程干净” 三道关卡全过了,这道题才配进训练题库。
这套流水线让训练环境规模扩大了数倍。
除了方法改变以外,刷题的整个基础设施也得到了升级。
slime 是智谱从 GLM-5 时代就一直在用的一套训练框架,你可以把它理解成一个自动化的刷题工厂。
5.3 在这套工厂上做了两层大改造。第一层是算法层面,新增了一批技术配置,最关键的一个改动,是让练习和考试的环境几乎完全一致。两者计算结果的平均差异控制在千万分之一的量级,比之前精确了 99.99%。
AI 的强化学习,本质上是成千上万轮的循环。先考试生成一批答卷,再根据答卷讲课更新模型,然后再考试、再讲课,无限循环。
如果练习和考试的环境有一点点不一样,每一轮都带入一点误差,一万轮下来误差就滚成了大雪球,模型可能学歪甚至直接崩掉。
就好比 NBA 比赛中,三分线弧顶距离是 7.24 米,底角是 6.7 米,但是 FIBA 国际篮联的三分线是 6.75 米,如果练习的时候以 FIBA 的标准,那么到了 NBA 中就适应不了那么远的三分线。
第二层是系统层面,智谱给这个出题工厂加了一堆效率优化。
常用的数据放到近处缓存,不用每次去远处取。相当于教材室紧挨教室,拿到教材就可以立马发给学生。
多个老师还可以自动切换,还能提前备好课,任务调度让每台机器都不闲着,还能根据题型自动调整到最优配置。这些优化叠在一起,长程编码任务的整体训练速度翻了 2.3 倍。
在 Agent 领域影响力最大的 Terminal Bench 3.0 基准数,得分从 5.2 的 4.6 分,暴涨到了 5.3 的 28.3 分,拿下开源模型第一。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 涨到 28.5,AutomationBench 从 26.2 涨到 48.2。
再看 DeepSeek 这边,从预览版到正式版,DeepSeek V4 Pro 也强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,而在正式版当中,新增了大量 Agent 专用的多步骤工具调用对话范例。
以前教模型的例子,是“ 帮我写封邮件” 这种一问一答。现在换成“ 把文件夹里所有 PDF 转成 Word” 这种真活儿。AI 得先扫文件夹,然后识别 PDF,并逐个进行转换。一切都完成后,汇总报告,一环扣一环。
同时,DeepSeek 把 GRPO 强化学习的奖励函数给重新设计了一遍。
预览版在 Agent 场景下有两个常见的硬伤,其一是工具调用死循环,反复调用同一工具但提取不到有用信息;其二是参数解析错误,JSON 格式错、必填字段漏。
正式版的奖励信号专门针对这两类失败做了惩罚,在需要 35 次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。
唐杰 vs 梁文锋+崔添翼
技术路线的背后从来都是人的理念。智谱和 DeepSeek 这场对抗,本质上是两种 AGI 路径的对撞。
智谱创始人唐杰在 7 月 11 日发布了内部信 《巨浪已来》,宣布启动“Touch High(摸高) 计划”。信中写到,未来两年不把重心放在商业变现上,集中资源冲 AGI 的下一个高地。
唐杰把 AGI 的突破拆解为三座必须翻越的大山,第一座是记忆,长上下文和 RAG 已经逼近记忆雏形;第二座是完全自治的智能体系统 (Autonomous Agent System,即持续学习和自我评判),模型迭代频次的提升本身就在逼近持续学习,前沿模型已显露自我评判的萌芽;第三座是自进化 (Self-Evolving)。
唐杰表示,“AI 训练 AI 已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了最宝贵的人力与时间。而在大模型时代,速度是最重要的,快速迭代会直接拉开认知的代际差距。”
前文提到的 GLM-5.3 后训练办法,本质上就是一种自进化。

不过自进化最有魅力的地方,并不在于它如何实现了开发者一开始给它规定的目标。就比如 GLM-5.3,的确通过自进化,让性能更强了。但最有魅力的地方在于,GLM-5.3 获得了极强的网络安全能力。
智谱给 GLM-5.3 做后训练时,确实往训练环境里加了一些漏洞挖掘的任务。初衷很简单,让模型找漏洞、分析漏洞的能力强一点。
结果训练规模上去了,事态也跟着失控了。
官方博客中写到,“ 我们本来以为它只是更会找单个漏洞,但出乎意料的是,它开始跨越漏洞利用的多个阶段,形成完整的攻击链计划。”
在 CyberGym 测试中,任务要求模型从白盒源码出发识别并验证漏洞,GLM-5.3 拿到了 84.5% 分,全球第一,压过了 Anthropic 的 Claude Mythos 5(83.8%) 和 GPT-5.6 Sol(83.6%)。
DeepSeek 在自进化这道题上,给出的答案是“ 插件”。梁文锋把模型基座冻结在 1.6T 不动,崔添翼带队的 DSH 框架则把“ 自进化” 发生的场所,从模型内部搬到了模型外部。
DSH 的核心设计原则只有五个字,“ 一切皆插件”(Everything is a Plugin)。模型接入、工具注册表、会话日志、审批策略、沙箱、存储、上下文管理、甚至驱动 Agent 运转的主循环本身,全都是可以拔插的积木。
底层的 Cordis 微内核只负责插件的加载、卸载和依赖管理,其他什么都不管。
DSH 在 GitHub 宣布开源的当天,也发布了一篇长达 88 页的论文 《时空可组合性的编程范式》,来阐述 DSH 的理论基础。
Cordis 最关键的特性叫“ 可逆效应”。它指的是,每个插件注册时产生的所有副作用都被追踪,卸载时自动回收,不留垃圾、不漏内存。
这意味着 Agent 可以在运行过程中随时更换插件,觉得这个搜索引擎不好用。OK,马上换下一个。甚至可以在 Agent 跑任务的时候换掉它的决策策略,类似于“ 热插拔” 一样,即便更改插件,运行状态也不会崩。
简单来说,传统的 Agent 非常死板,师傅怎么教,他就怎么学,只要超出知识点就会无能为力。DSH 发现缺扳手时,现场自己锻造一把、插到手上接着拧螺丝,用完还能拆下来。
插件化还有另外一层含义,那就是相互独立。传统软件之间存在强依赖关系,改了 A,可能 B 就会受牵连。插件之间相互独立,因此可以相互演化,进而带动整个模型实现自进化。
DSH 发布不到两天,就在 GitHub 就收获 10 万颗以上的星星,可见开发者社区对它的青睐。
但智谱和 DeepSeek 其实是两种完全不同的自进化观。
唐杰追求的是“ 模型自己变聪明”,进化发生在训练阶段,目标是提升模型本身的智商;梁文锋和崔添翼追求的是 “ 模型的身体可以无限重组”,进化发生在推理和运行阶段,模型本身的智商不变,但它的“ 手脚” 和“ 器官” 可以随时替换、扩展、升级,能力边界由插件生态的丰富程度决定。
如果说唐杰的自进化是生物学意义上的进化 ,基因在迭代中变得更聪明。那梁文锋+崔添翼的自进化就是工具意义上的进化,人本身没变,但从石器到青铜器到蒸汽机,工具的重组让人的能力指数级扩张。
两条路线谁对谁错,没人能定夺,然而智谱的股价成了这场对抗的风向标,甚至被网友戏称为“ 衡量 DeepSeek 模型能力最好的测试集”。
4 月 24 日 DeepSeek V4 预览版发布当天,智谱暴跌逾 9%,随后几个交易日持续下挫,4 月 28 日盘中一度跌超 13%、跌破千元大关。
市场的逻辑是,DeepSeek 又强又便宜还开源,而智谱这边却在涨价。
从 2 月开始智谱连续上调 API 定价,一季度累计涨幅约 83%,4 月 GLM-5.1 发布时完成年内第三次提价。
这就导致智谱的商业化空间被挤压,估值逻辑遭到了质疑。
8 月 13 日,V4 Pro 正式版遭遇乌龙事件,凌晨静默发布、白天官网横幅撤下公告删除、后端指纹改回 Preview 状态、不到 24 小时又重新发布。当天智谱股价反而从开盘 1230 港元涨到收盘 1317 港元,涨幅约 9%。
对手“ 翻车” 被解读为自身利好,说明市场已经从“DeepSeek 出模型 = 智谱利空” 的简单零和逻辑,转向了对两家路线可持续性的更微妙博弈。
8 月 14 日 GLM-5.3 发布当天,智谱股价高开低走,开盘 1356 港元、盘中最高冲到 1435 港元,收盘却跌到 1270 港元,跌幅 3.57%,从日内最高点算回撤超过 11%。
这可能意味着投资者不再只看模型的性能本身,而是唐杰的“ 自进化闭环” 和梁文锋+崔添翼的“ 插件化生态” 之间,哪条路更可能跑到 AGI 的终点。
GLM-5.3 虽然八项赢七项,但市场认为这是“ 符合预期” 的后训练迭代,没有超出基座不变的框架。V4 Pro+DSH 的组合,或许才是长期变量。
从“ 价格屠夫” 到集体涨价
前面说完了智谱涨价,现在该说说 DeepSeek 涨价了。
DeepSeek 一直以“ 价格屠夫” 著称,早在 V3 时代,DeepSeek 就用极致的性价比,打穿了整个行业的价格底线。后面到了 V4 预览版,DeepSeek 又延续了这个策略,缓存命中输入低至 0.025 元/百万 token,未命中输入 3 元,输出 6 元,几乎是海外旗舰模型的几十分之一。
但 8 月 13 日晚间,DeepSeek 在发布 V4 Pro 正式版的同时官宣了 API 调价,从 8 月 17 日零点生效。
在这次价格调整中,DeepSeek 首次引入了峰谷分时定价,高峰时段为北京时间 9:00-12:00 和 14:00-18:00,空闲时段价格为高峰的一半。
V4 Pro 高峰时段缓存命中输入从 0.025 元涨到 0.3 元,涨幅 12 倍;未命中输入从 3 元涨到 9 元,涨幅 3 倍;输出从 6 元涨到 27 元,是原来的 4.5 倍。空闲时段则分别为 0.15 元、4.5 元和 13.5 元。V4 Flash 也同步调价,空闲时段缓存命中 0.05 元、未命中 1.5 元、输出 4.5 元,高峰翻倍。
对于一个以“ 便宜” 为核心竞争力的公司来说,DeepSeek 这番涨价势必削弱了公司的吸引力。
开发者圈子里,从“ 梁文锋的恩情还不完” 的论调,变成了“ 梁圣变梁子” 的调侃。社区吐槽称,DeepSeek 每贵一块钱,就要破产几百家 OPC(单人公司),现在涨了好几倍,几乎已经不给这些独立开发者留退路了。
不过涨价的并非只有 DeepSeek 和智谱,全行业都在涨价。
DeepSeek 作为最后一个坚持低价的头部玩家,它的涨价标志着一个时代的结束。用低价换规模、用补贴换市场份额的阶段,正式落幕了。
涨价的本质不是算力贵了,这是所有人都能用的借口。真正的原因是公司长大了。
AGI 研发是个无底洞,唐杰的摸高计划要投入百亿级做可解释性、建合成数据工厂、搞自治智能体系统,梁文锋要除了迭代模型以外,现在还要养 DSH 的开源生态。
不能一直靠融资和烧钱,终究得靠自己造血。当模型能力逼近海外第一梯队,而模型价格却继续保持海外头部的几十分之一出售时,本质上是在贱卖自己的技术溢价,也是在告诉资本市场我还没准备好挣钱。
涨价是从成本加成定价转向价值定价,模型值多少钱,应该由它能替用户创造多少价值决定。
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App

















