2026 年 8 月 23 日 星期日
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

更强的 GLM-5.3,为什么没有刷屏?

2026 年 8 月 23 日
在 商业
阅读时间: 2 mins read
阅读:735
A A

Related articles

3万亿美元隐形债务浮出水面:「AI基建潮」会引发下一场次贷危机吗?

3 万亿美元隐形债务浮出水面:「AI 基建潮」 会引发下一场次贷危机吗?

2026 年 8 月 23 日
王坚的「遗产」,为阿里留出后路

王坚的 「遗产」,为阿里留出后路

2026 年 8 月 22 日


文 | AIX 财经,作者 | 雷晶,编辑 | 金玙璠

8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。8 月 19 日,API 正式开放调用,定价与 GLM-5.2 持平。

GLM-5.3 沿用 GLM-5.2 模型的基座,主要靠扩大后训练规模提升 Coding、长程 Agent 和网络安全能力。目前,模型已经向全部 GLM Coding Plan 用户开放,并上线 ZCode、Claude Code、OpenCode 等主流编程工具。模型权重将于下周五开源。

从测试结果看,GLM-5.3 进步明显。在 Artificial Analysis 最新综合智能指数中,GLM-5.3 拿到 60 分,进入全球前沿模型区间,和 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰处在同一档,并与 Kimi K3 并列开源模型第一。此外,按照 Artificial Analysis 统计的单任务成本,GLM-5.3 在同档模型中属于低成本选手。

但模型能力提升,并没有延续与前代的市场热度。4 月 GLM-5.1 发布时,智谱收盘上涨 11.5%;6 月 GLM-5.2 发布,股价又涨了 32.8%。但 GLM-5.3 模型发布当天,智谱股价下跌 3.6%。模型发布后的行业讨论度,也远不如此前几次旗舰亮相。模型明明更强了,为什么没有再次成为市场焦点?

这种反差并不意味着 GLM-5.3 没有变强,而是说明在国产模型密集迭代、能力差距快速收窄的当下,模型跑分领先已经很难让市场兴奋。对智谱来说,更重要的问题是,更强的模型还能带来多大的差异化优势?这种优势又能不能继续转化成产品和收入?

01.GLM-5.3 进步了多少?

GLM-5.3 最值得关注的变化,是通过扩大后训练规模,取得了较为明显的成绩提升。简单理解,智谱没有重新训练一个更大的基座模型,而是让现有模型在更复杂、更接近真实工作的环境里反复训练,把已有能力继续 「练深」。

大模型研究员曾小健告诉 「AIX 财经」,预训练更多是在增加模型 「读过的东西」,后训练则是在增加模型 「做过的事情」。模型不只是继续学习知识,还要进入真实环境做任务、拿到反馈,再根据结果调整自己的做法。

支撑起这轮后训练的,是此前打造的一套训练方式。IndexShare 主要降低长上下文的计算成本;SAO 让一条任务完成后就可以进入训练,不必等整批任务全部结束;slime 框架则把模型执行任务和根据结果更新模型两个环节拆开运行,减少不同任务耗时差异带来的算力闲置。

曾小健举例,假设 100 个 Agent 任务里,有 80 个十分钟就能完成,有 15 个需要半小时,最后 5 个却要跑两个小时。传统训练方式会要求这一批任务全部结束后才能进入下一步,先完成的任务也只能干等着最慢的那 5 个,昂贵的 GPU 就会闲着。新的框架不再等所有任务一起 「交卷」,这样可以减少等待时间,提高算力利用率。

训练效率提高之后,还得有足够多的 「题」 给模型练。GLM-5.3 搭了一套自动生成训练环境的流程。Research Agent 负责从真实工作中寻找任务,再由 Judge Agent 亲自跑一遍,确认任务确实能完成;系统还会检查模型有没有利用评分漏洞抄近路。可以理解为让 AI 自己出题、试做和验题,再把合格的题目送进训练。

了解完这个大的前提,我们来具体看看 GLM-5.3 在哪些方面有了进步。

这一套方法的效果首先体现在编程能力上。从基准测试成绩来看,GLM-5.3 提升比较明显的项目,大多和长程软件工程、终端操作和自动化任务有关。比如,强调长程软件工程的 DeepSWE v1.1,从前代的 46.2 分提高到 66.9 分。说明 GLM-5.3 更能把一项复杂任务从头干到尾。它能够理解一个陌生项目,自己定位问题、调用工具、修改代码,再根据测试结果继续修正。

智谱自己的 Code Bench 也在强调这一点。这套测试直接把模型放进本地开发环境,任务设置不同难度,在最高难度下,GLM-5.3 用平均约 7.5 万输出 Token 取得 34.5% 的成绩,GLM-5.2 则需要约 9.6 万 Token,成绩只有 23.4%。

曾小健认为,完成率提高、Token 消耗反而下降,比单纯的跑分上涨更值得关注,这说明模型学会了更有效地探索,而不是靠堆更长的思考时间换成绩。

独立开发者李然的体验也印证了这种变化。他认为,GLM-5.3 相比 GLM-5.2 进步明显,ZCode 的 Goal Mode 是他感受最深的功能。给定一个目标后,模型会持续推进、检查和验证,直到任务完成,长任务的可靠性比上一代更高。

另一块提升更加显眼,是网络安全。在考验漏洞利用推理的 ExploitBench 中,GLM-5.3 从前代的 24.4% 提高到 54.4%,提升超过一倍。安全任务要求模型不仅读懂代码,还要继续判断漏洞藏在哪里、怎样触发,对代码理解、工具调用和长程规划的要求更高。

这项能力也已经进入真实项目。智谱官方提到,从 GLM-5.2 开始,智谱就联合国内多家安全机构,用模型持续寻找真实项目中的漏洞。到 GLM-5.3 发布时,经过专家复核、筛选和去重,累计发现 2436 个漏洞,覆盖 269 个项目,其中 1097 个属于中高危问题,部分漏洞已经存在数十年。

综合来看,GLM-5.3 相对前代的变化在于:编程能力更接近完整工程任务,长任务的稳定性有所提升,网络安全能力的进步幅度尤其明显。

但一款模型有没有竞争优势,还得放到同期对手中看。我们选择阿里、月之暗面和深度求索的最新旗舰模型作为参照,一方面因为这几款模型都在近期迎来更新,另一方面,Coding、Agent 和长程任务也是它们共同投入的重点方向。

单从成绩来看,GLM-5.3 的确拿到了不少第一,其中网络安全的优势最明显;Coding 和长程 Agent 也已经进入第一梯队,但和 Kimi K3、DeepSeek V4 Pro 相比,没有形成明显差距。

再看各家手里的牌。DeepSeek V4 Pro 仍有综合能力和价格优势;Kimi K3 在长程软件工程上与 GLM-5.3 几乎贴身竞争,同时拥有原生多模态,能力覆盖更完整;Qwen3.8-Max 虽然部分跑分不占优,但背靠阿里生态,在企业工作流和应用落地上更有基础。

所以,GLM-5.3 确实更强了,但还没有形成让同期国产旗舰模型短期难以追赶的优势。

02. 大模型发布,难有 「爆款」

那么,为什么 GLM-5.3 的能力提升没有带来同等规模的传播?

一个直接原因,是它选择的升级方向相对 「专业」。这轮更新主要升级的两个方向,一个是编程能力,主要服务开发者;另一个是网络安全能力,受众主要是安全研究人员和企业客户。能力都实用,但受众也相对集中。

这和 GLM-5.3 发布前的用户期待存在错位。此前智谱创始人唐杰在 X 上征集用户对新模型的期待,视觉、多模态能力是呼声较高的方向。原因并不难理解,现在越来越多的 Agent 任务已经不只是处理文字。做网页要看截图,改 UI 要理解设计稿,分析报告可能包含图表和 PDF,甚至写代码时也经常需要根据页面效果继续调整。

李然提到,不少开发任务其实很难完全用语言描述清楚,尤其是页面设计和创意编码。有了视觉能力后,模型能直接 「看结果」,就不用反复把需求翻译成文字。在他的实际使用中,GLM-5.3 做常规代码任务好用,水平高过 Kimi K3、略逊于 GPT-5.6 Sol,但到了游戏生成、创意编码这类依赖视觉反馈的场景,体验就比较一般,还出现过生成的页面按钮都是歪的情况。

更大的变化在于,新模型的新鲜感正在被密集的发布节奏快速消耗。仅智谱一家,GLM-5.1 在 4 月发布,GLM-5.2 在 6 月更新,8 月 14 日 GLM-5.3 又接棒,基本保持两个月左右一次旗舰迭代。同行自然也没闲着。7 月中旬 Kimi K3 上线,8 月初 Qwen3.8-Max 跟进,8 月中旬 DeepSeek V4 Pro 正式版发布。

不到一个月,就连续迎来四款国产旗舰模型。一个模型刚刚凭跑分冲到前面,几周后就有新版本把它盖过去。

频率提高之后,「第一」 的含金量就没那么高了。前两年,一家公司突然在某项核心能力上追平甚至超过海外旗舰,很容易成为行业热点事件。到了现在,头部国产模型已经基本站到了相近的能力区间。智谱这次把 Coding 往前推了一截,Kimi 下一代也可能继续强化长程软件工程,DeepSeek 做好后训练,同样可以迅速追赶 Agent 任务。领先的窗口期,开始按周计算。

能力趋同的背后,是各家在解同一道题。Coding 需要更好的训练环境和高质量代码数据,Agent 需要更长的任务轨迹和工具调用训练,多模态需要补足图片、视频等信息理解。一家公司验证出一条有效路径以后,同行很快就会投入算力、数据和工程资源。结果就是大家都在卷 Coding、强调 Agent、拉长上下文、补多模态。GLM-5.3 提升的方向,恰好是竞争最拥挤的方向。

「爆款」 的门槛也因此变高了。光靠能力提升不够,还得有一个 「人无我有」 的话题点。以与 GLM-5.3 几乎同期发布的 DeepSeek V4 Pro 正式版为例,深度求索还同步开源了首款 Harness 产品,主打 「一切皆插件」,通过模型、工具、Agent 运行组件都可以重新组合的玩法给常规升级造出了新话题。

这样来看,GLM-5.3 没有形成此前的传播热度几乎是必然。能力的提升没有超出预期,方向上又绕开了用户最想要的多模态,发布的时间节点还撞上 DeepSeek。

03.GLM 之外,智谱还需要什么?

回到公司层面,真正影响长期价值的,是过去靠编程跑出来的增长还能不能延续。

2025 年 9 月,智谱推出 GLM Coding Plan。进入 GLM-5 系列后,又持续强化编程和长程任务能力,并进一步推出编程工具 ZCode。开发者愿意为效率付费,编程成了智谱 API 增长最快的场景,也初步验证了模型能力、用户调用和商业收入之间的联系。

但智谱早期吃到的先发红利正在减弱。其他国产厂商都已经把编程当作旗舰模型的升级方向,开发者可选择的模型越来越多。此外,智谱也在告别低价获客。GLM Coding Plan 刚推出时,入门价格只需 20 元/月,7 月底全面开放购买后,Lite 版已经涨到 118 元/月。同时改为积分制,设置每 5 小时和每周的额度上限。

涨价有现实的难处。Coding Agent 比普通聊天 「吃」Token,一项长任务可能连续运行数小时,消耗数万甚至数十万 Token。需求在涨,智谱的推理算力供给却有限,低价很难长期维持。

但对开发者来说,价差足够大时,便宜就会成为换模型的理由。况且模型的切换成本并不高,开发者完全可以同时使用多款模型。

所以,编程场景已经证明智谱能够把模型能力变成收入,但接下来的考验,是能否把这批靠模型优势吸引来的用户留下来。

智谱的解法是往产品上走。单纯卖 API,开发者可以随时切换模型;但进入 Agent 之后,项目上下文、工具配置和工作流程会逐渐沉淀,迁移成本自然就高了。ZCode 和 AutoClaw 的作用,就是让智谱从模型供应商进一步进入真实工作流,在模型能力之外建立更长期的用户关系。

到了产品层,智谱面对的是两拨对手。一边是阿里、字节这样的大厂,手握用户、账号、数据和业务生态,可以把 AI 直接接进办公、云服务和消费场景;另一边是月之暗面、深度求索这样的模型公司,正在不断向上做产品。智谱既要和大厂拼入口,又要和同类公司抢开发者。

产品对智谱还有一层价值在于用户反馈。曾小健提到,GPU 可以买,开源框架可以复制,算法论文会扩散,但真实工作环境、任务分布、可靠的验证机制和用户反馈会成为更难复制的资产。沿着这个判断看,产品除了能积累订阅用户,还能让这些真实反馈进一步帮助它打造下一轮后训练的 「真题」。

模型能力带来用户,产品沉淀真实任务,真实任务再帮助模型继续提升,这套循环转起来,智谱才能把阶段性的模型优势沉淀得更久。

但只有编程一个场景还不够。GLM-5.3 新强化的网络安全已经表现出明显优势,也有机会打开企业需求,但还没有验证出能带来大规模、持续增长的 Token 调用。

智谱的 MaaS 业务已经证明市场愿意为模型能力付钱。2025 年,云端 MaaS 服务收入占总营收 26.3%;截至 2026 年 3 月,MaaS 平台 ARR 约 17 亿元,过去一年增长约 60 倍。与此同时,本地化部署收入仍占 73.7%。这说明 「中国版 Anthropic」 的故事已经有了商业基础,但距离主要依靠标准化 API 和产品持续放大收入,还有一段路要走。

7 月,唐杰提出 「摸高计划」,未来两年继续押注长程任务、自治智能体系统、完全自我训练和安全治理。智谱仍要继续把模型能力往上推,但商业上还需要找到第二个、第三个像编程一样的高频付费场景,把技术领先尽快转化为产品使用和收入增长。

GLM-5.3 证明智谱还能把模型做强,更难的考题是,如何把这种能力持续转化为产品和生意。

*应受访者要求,李然为化名。

广告

相关 文章

3万亿美元隐形债务浮出水面:「AI基建潮」会引发下一场次贷危机吗?

3 万亿美元隐形债务浮出水面:「AI 基建潮」 会引发下一场次贷危机吗?

来自 周天财经
2026 年 8 月 23 日
0

文  | 智讯智库,作者 | 许倍过去讨...

王坚的「遗产」,为阿里留出后路

王坚的 「遗产」,为阿里留出后路

来自 周天财经
2026 年 8 月 22 日
0

文 | 数读社不知不觉间,淘宝闪购上的奶...

破防了,WRC上的机器人,比我还会过日子

破防了,WRC 上的机器人,比我还会过日子

来自 周天财经
2026 年 8 月 22 日
0

文 | 节点财经,作者 | 王俊 走进 2...

从数参数到算算力:唐杰谈 Scaling Law 的新标尺

从数参数到算算力:唐杰谈 Scaling Law 的新标尺

来自 周天财经
2026 年 8 月 22 日
0

大模型圈流传着一句话,参数越多,模型越强...

一线调研:谁在为农夫山泉的「印钞机」负重前行?

一线调研:谁在为农夫山泉的 「印钞机」 负重前行?

来自 周天财经
2026 年 8 月 22 日
0

文 | 好看商业,作者|杨柳,编辑|安心...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2
【ESG-V评级观察】北京上市公司价值重估:金融与硬科技抬升上限,地产与部分传统产业承压

段永平还是深爱泡泡玛特

2026 年 8 月 23 日

成都潮宏基今日黄金价格查询 (2026 年 8 月 12 日)

2026 年 8 月 23 日

李强主持召开国务院常务会议 听取新一代通信网建设情况汇报 部署进一步清理拖欠企业账款工作 研究持续改善空气质量有关工作 审议通过 《电力安全事故应急处置和调查处理条例 (修订草案)》 和 《市场监督管理所条例 (草案)》

2026 年 8 月 23 日
更强的GLM-5.3,为什么没有刷屏?

更强的 GLM-5.3,为什么没有刷屏?

2026 年 8 月 23 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录