2026 年 8 月 22 日 星期六
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

从数参数到算算力:唐杰谈 Scaling Law 的新标尺

2026 年 8 月 22 日
在 商业
阅读时间: 1 min read
阅读:824
A A

Related articles

一线调研:谁在为农夫山泉的「印钞机」负重前行?

一线调研:谁在为农夫山泉的 「印钞机」 负重前行?

2026 年 8 月 22 日
「割裂」的市场:十万亿级中国银发经济的真实地图丨行业风向标

「割裂」 的市场:十万亿级中国银发经济的真实地图丨行业风向标

2026 年 8 月 22 日


1

大模型圈流传着一句话,参数越多,模型越强。智谱创始人唐杰近日在 X 平台发布长文,对这句话提出了质疑。

文章题为 《Thoughts About Scaling Law》(关于 Scaling Law 的一些思考)。开篇先抛出发布会上最常见的那个问题,Scaling 还在继续,但 Scaling 的到底是什么?他的回答是,参数量从来不能单独决定一个模型的能力,数据规模、算力如何分配、推理时在什么条件下部署,缺一不可。行业的评价标尺,正在从 「数参数」 切换到 「算算力」。

这不是学者一时兴起的感慨,而是牵动整个产业判断的一次重新定调。过去几年,几乎所有大模型公司都把参数量当作最醒目的宣传口径,从 1750 亿、5300 亿到上万亿,数字不断刷新。但真实世界给出的答案恰恰相反。那个把参数量推向极致的标志性实验,早在 2021 年就为 「参数失灵」 埋下伏笔。

万亿参数的岔路

时间回到 2021 年 1 月。Google Brain 团队发表论文 《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》,用稀疏激活的混合专家架构 (MoE) 训练出一个 1.6 万亿参数的 Switch-C。该模型包含 2048 个专家,权重文件达 3.1TB,是当时规模最大的语言模型,参数量一举超过 1750 亿参数的 GPT-3。

但这里有一个容易被忽视的细节,1.6 万亿是 「总参数」,不是每次都会调用的参数。Switch Transformer 的门控网络每次只把输入路由给一个专家,一次前向传播真正被激活的参数,只占总数的极小比例。这正是 MoE 的核心设计,它把 「知识仓库的容量」 和 「一次能调动的算力」 分成两件事。

效果很快显现。Switch-C 的预训练速度比谷歌上一代最大的密集模型 T5-XXL(110 亿参数) 快 4 倍,训练时间仅为后者的四分之一。更小的 Switch-Base 对 T5-Base 实现了 7 倍预训练加速。单看这一点,稀疏化让万亿参数成为可能,是一次扎实的工程胜利。

真正值得关注的是论文里的下游任务数据。在相同计算量 (FLOPs) 的对照下,Switch-Base 在 SuperGLUE 上比 T5-Base 高出 4.4 分,在 Winogrande 上高出 6.7 分,在闭卷 TriviaQA 上高出 6.2 分,知识类任务几乎全线占优。但在 ARC Challenge 这类需要多步推理的题目上,Switch-Base 以 32.8 分输给了 T5-Base 的 35.5 分,落后 2.7 分。

这暴露了一个事实,扩大总参数,换来的是 「记住更多」,而不是 「想得更深」。参数量的膨胀对不同任务的作用是错位的。知识库里的书多了,不代表读者更会推理。

总参数、激活参数、FLOPs

要理解这轮错位,得先把总参数、激活参数、FLOPs 这三个常被混为一谈的概念分清。

总参数量相当于一座图书馆的藏书总量,决定模型能装下多少知识、多少事实和长尾信息,是容量的上限。激活参数量是这次阅读真正翻开的那几本书。在密集模型里,每次前向传播所有参数都会参与,总参数和激活参数是一回事;在 MoE 架构下,门控网络只挑选一小部分专家,激活参数可能只有总参数的百分之几。FLOPs 则是读者真正付出的脑力劳动量,衡量每次 「思考」 实际消耗的浮点运算次数,是能力与成本的真实标尺。

唐杰在文中打了一个比方,总参数量像模型的仓库,决定它能装多少知识;激活参数量与有效深度,才接近模型一次能调动多少能力、能把推理链走多远。他举了一个安全场景的例子。模型记住更多 CVE 漏洞,只能说明它见过更多案例;但真正遇到一个新漏洞,它要从异常代码一路追到触发条件,再设计验证方法和利用路径,连续走完二十步推理,途中不能丢掉任何线索。这种能力,恰恰不在总参数量里。

于是 「FLOPs 是智能,参数是知识」 这句话,成了理解行业口径失真的关键。参数决定模型 「知道多少」,FLOPs 决定模型 「能想多深」。前者是库存,后者是算力,两者不在同一个坐标系里。

这套错位并非一开始就被看清,行业是一步步试错走过来的。

2020 年,OpenAI 的 Kaplan 团队得出结论,参数规模的增长应当快于数据增长,比例约为 2.7 比 1。这个结论带动了一批超大规模模型的集中涌现,GPT-3、Gopher、MT-NLG 接连登场,万亿参数一度被视为通往强智能的必经之路。唐杰事后复盘说,早期 Scaling Law 里的拟合误差会随算力量级的提升不断放大,模型越大,参数与数据之间的资源错配就越严重。

转折发生在 2022 年。DeepMind 的 Hoffmann 团队对 400 多个模型重新实验,得出结论,在固定计算预算下,最优配比应接近每参数 20 个 Token,参数和数据应当近似同步增长。这就是赫赫有名的 Chinchilla Scaling Law。一个 700 亿参数、以 1.4 万亿 Token 训练的 Chinchilla,在绝大多数评测任务上超过了 1750 亿的 GPT-3、1780 亿的 Jurassic-1、5300 亿的 MT-NLG 和 2800 亿的 Gopher,MMLU 平均准确率 67.5%。这一结果让行业重新思考方向,参数并非堆得越多越好,而是要和数据配平。

但唐杰紧接着又指出,Chinchilla 给出的答案也不是终点。它优化的是 「训练一次、评测一次」 的模型,而今天的主流模型每天可能被调用数十亿次,推理成本在全生命周期里早已远超一次性训练成本。把推理成本纳入目标函数之后,最优解再次移动,向 「更小模型、训练更久」 的方向漂移。他拿 Llama-2-7B 和 Gemma-2-9B 举例,两者的每参数 Token 数分别约为 290 和 889,远超 Chinchilla 时代的 20,是刻意 「过训练」 的结果。

更进一步,2025 年 Roberts 等人的研究显示,最优的每参数 Token 数不是一个常数,而是随任务变化。记忆类任务更依赖参数规模,推理类任务更依赖数据量;在固定每参数 Token 数的条件下,继续扩大总参数反而会降低推理能力,激活更多专家才能稳定提升推理表现。这与 Switch Transformer 的实验相互印证,把 「参数失灵」 的结论从经验上升成了规律。

回过头看,万亿参数这一轮,是整个领域一起走的一段弯路,走完之后又一起折返。

最优 Scaling 的答案

问题在于,学术界的认识已经迭代了好几轮,产业界的宣传口径却还停留在第一轮。

一个普遍的现象是,无论国内还是海外,混合专家模型的发布会几乎只报总参数量。某某模型 5000 亿参数、某某模型万亿参数,数字越喊越大,但这些数字在 MoE 架构下早已失真。总参数 1.6 万亿的 Switch-C,每次真正激活的专家极为有限;今天市面上那些号称数千亿参数的 MoE 模型,实际一次推理调动的参数可能只有几十分之一。拿总参数去比大小,就像拿图书馆的藏书量衡量一位读者的思考深度,听起来声势不小,实则答非所问。

更隐蔽的陷阱藏在 「Token 参数比」 里。既然 Roberts 等人的研究已经证明这个比值会随任务变化,那么任何脱离具体任务、只拿一个参数量做横向对比的行为,本质上都是营销话术。记忆类任务里多参数是优势,推理类任务里多参数甚至可能是负担。厂商只报一个对自己最有利的数字,却从不说明它针对的是哪类任务、激活了多少专家、推理时消耗多少 FLOPs。

对投资人来说,这直接关系到估值模型是否需要重写。过去评估一家大模型公司,先看参数量;今天这个指标已经不够用了。真正决定产品落地上限的,是训练算力的分配效率和推理时的 FLOPs 预算。一个推理成本更低、FLOPs 效率更高的中等规模模型,很可能在产品化和商业化上跑赢一个纸面参数量惊人、却负担不起推理算力的庞然大物。用户购买的终究是 「能想多深」,不是 「仓库有多大」。

唐杰用一个自己主导的实验,为这套新标尺提供了实证。

他旗下的 GLM-5.3,与上一代 GLM-5.2 共用完全相同的基座、相同的架构、相同的 753B 总参数 (约 7530 亿) 和 40B 激活参数 (约 400 亿)。唯一的变量,是增加了一个月的长时域环境 Scaling 与强化学习 (RL) 后训练。结果,GLM-5.3 在 AA 评测指数上从 53 分升至 60 分,能力跃升 「并非微小」。参数一个没加,能力实实在在提升了。

这几乎是一次标准的控制变量实验。当基座模型的参数规模已经足够装下知识,额外的能力提升往往来自其他变量的调整,尤其是后训练阶段,而不是继续堆参数。唐杰也坦言,选择后训练这个变量,是因为它当下改进空间最大,并不代表其他变量已经用尽。基座规模、预训练数据、单次前向算力投入,都还在他的考量范围内。这个实验同时回应了外界对智谱 「为何不训全新基座」 的质疑。下一个最值得调整的变量,未必是参数。

这套逻辑一旦成立,整个产业的竞争叙事就要改写。大模型的军备竞赛,正在从 「谁参数多」 切换到 「谁把有限的 FLOPs 用得更聪明」。训练阶段的算力分配、推理阶段的 FLOPs 预算、后训练阶段的强化学习,每一项都比纸面参数量更接近产品落地的真实上限。参数量依然重要,它决定了知识的上限,但不再是那个可以单独拎出来炫耀的标尺。

把视角从论文拉回产业,这件事对三类人的意义截然不同。

对模型厂商而言,继续拿总参数做营销,是在透支行业信任。更审慎的玩家已经开始改变口径,报激活参数、报推理成本、报针对具体任务的实测表现。谁先诚实地把 「FLOPs 效率」 摆上台面,谁就在下一轮产品竞争中占据主动。

对投资人而言,尽调清单需要更新。与其盯着总参数量,不如追问三件事:这个模型的激活参数是多少,推理时每 Token 消耗多少 FLOPs,它在目标场景里的 Token 参数比是否合理。一个能回答这三个问题的团队,远比一个只会强调万亿参数的团队更值得下注。

对使用方而言,选型时最该警惕那些 「大而失真」 的宣传。可以记住那条朴素的判断,参数决定它知道多少,FLOPs 决定它能想多深。实际要看的,是后者。

回看这五年,行业先一拥而上堆参数,随后又集体转向补数据,如今再把推理成本和后训练纳入账本。每一次转弯,改写的都是同一个答案,所谓 「最优 Scaling」,其实会随任务、架构和使用方式不断变化。衡量模型的能力,重点正转向算力的分配与使用效率。(本文首发钛媒体 APP,作者 | AGI-Signal,编辑 |秦聪慧)

广告

相关 文章

一线调研:谁在为农夫山泉的「印钞机」负重前行?

一线调研:谁在为农夫山泉的 「印钞机」 负重前行?

来自 周天财经
2026 年 8 月 22 日
0

文 | 好看商业,作者|杨柳,编辑|安心...

「割裂」的市场:十万亿级中国银发经济的真实地图丨行业风向标

「割裂」 的市场:十万亿级中国银发经济的真实地图丨行业风向标

来自 周天财经
2026 年 8 月 22 日
0

2026 西普会银发健康峰会现场,一组产业...

王振辉重返京东,先接住外卖大战的沉没成本

王振辉重返京东,先接住外卖大战的沉没成本

来自 周天财经
2026 年 8 月 21 日
0

文 | 强调 Next8 月 13 日,王振辉以...

山姆,终于又开始干正事了

山姆,终于又开始干正事了

来自 周天财经
2026 年 8 月 21 日
0

文 | 壹弧消费,作者丨李傲晨下半年六店...

【钛晨报】事关外卖骑手等劳动权益保障,工会工作「十五五」规划发布;宇树发布仿生7轴灵巧机械臂,售价9900元起;台积电1.6nm级A16工艺完成开发验证,目标Q4量产

【钛晨报】 事关外卖骑手等劳动权益保障,工会工作 「十五五」 规划发布;宇树发布仿生 7 轴灵巧机械臂,售价 9900 元起;台积电 1.6nm 级 A16 工艺完成开发验证,目标 Q4 量产

来自 周天财经
2026 年 8 月 21 日
0

【钛媒体综合】 从全国总工会了解到,近日,...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2
余恩源:新石器要建1000万辆无人车和1亿个机器人的物流网络

余恩源:新石器要建 1000 万辆无人车和 1 亿个机器人的物流网络

2026 年 8 月 22 日
武汉企业网站项目里,功能不是越多越好

武汉企业网站项目里,功能不是越多越好

2026 年 8 月 22 日
A股大消费已经跌出幻觉,食品饮料龙头们需要一场叙事重启

WRC2026 深度观察:机器人行业,正在去表演化、去差异化

2026 年 8 月 22 日
从数参数到算算力:唐杰谈 Scaling Law 的新标尺

从数参数到算算力:唐杰谈 Scaling Law 的新标尺

2026 年 8 月 22 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录