(本文作者为 字母 AI,钛媒体经授权发布)
文 | 字母 AI
DeepSeek V4.1 Flash 发布后,不仅速度变快,而且内容更准确,还有原生多模态。
全网对 DeepSeek V4.1 Flash 好评如潮,梁文锋再次被奉为“ 梁圣”。
相较于 V4 Flash,V4.1 Flash 最大的特点是推倒重来,采用了和 V4 Flash 完全不同的非对称结构。
这也就是说,V4 在结构上积累的训练配方、优化技巧、工程适配,到了 V4.1 这里,大部分都作废了。
现在的 DeepSeek 早就不是一家小作坊了,而是一个拥有数百名员工的企业,想要重起一个新的结构不仅费时,还很费力。即便如此,梁文锋也要狠下心,对 V4 推倒重来。
新结构听起来确实很像一个营销用的噱头,不过答案其实就在 DeepSeek V4.1 Flash 的官方论文当中,DeepSeek 的旧架构,已经装不下新的训练目标了。
那么这个新的目标又是什么呢?我认为,很可能是“ 入口”。
DeepSeek 为什么要推倒重来?
通常来讲,先有模型,后有 Harness。厂商根据模型的能力和特点来构建 Harness。然而 DeepSeek V4.1 Flash 却是被 DSH 给“ 反哺” 出来的。
官方论文表示,V4.1 Flash 的后训练遵循标准的 SFT→ RL→ 在线蒸馏 (OPD) 范式,没有任何算法改动。关键的地方在于,所有实质性变化都在数据流水线当中,大规模自动合成 Agent 任务与环境,数据、任务、rollout 渐进式扩增。
RL 训练时让模型在 6 种不同的 Agent 框架里反复试错,数据量、任务种类、试错轮次一路放大。DSH 是这 6 个训练场里最重要的一个,V4.1 Flash 还专门针对 DSH 的不同操作模式做了定向训练。
DSH 从 DeepSeek V4 Pro 的伴生产品,摇身一变成了 V4.1 Flash 的老大哥。
为了满足 DSH 的偏好,DeepSeek V4.1 采用了全新的结构。
论文里是这么介绍的,新结构让模型在 prefill 阶段每 token 只需要激活 8B 的参数、decode 阶段激活 16B,进而大幅改善“ 输入密集的 agent 工作负载” 的成本效率。
为什么“ 输入密集” 会成为麻烦?
过去的模型结构是为"聊天"设计的,用户问一句,模型答一句。这就造成了输入短、输出长,模型只会记住当前这一轮对话的上下文。
但在 Agent 时代,几十轮的中间状态一直挂在上下文里,输入动辄几十万 token,远大于输出。
2026 年 4 月,密歇根大学、斯坦福大学等院校联合发布论文 《AI 是怎么花你钱的?》(How Do AI Agents Spend Your Money?),其中就提到这样一件事,在 agentic 代码任务中,输入与输出的 token 比高达 154:1。
于是 DeepSeek 选择推倒重来。V4.1 Flash 采用了非对称结构 Causal-Encoder-Decoder(CED)。

V4.1 Flash 的语言主干共 40 层,如果按照以前的 Transformer(decoder-only) 那样,这 40 层应该是一模一样的。每一层都同时负责“ 读” 和“ 写”,同时处理给它的输入,也处理输出,而且每一层都要自己攒一份 KV Cache。
CED 的“ 非对称”,指的是把这 40 层拆成前 20 层编码器、后 20 层解码器,编码器只负责“ 读”,把输入压成摘要,解码器只负责“ 写”,照着摘要生成回答。
就像汽车的流水线一样。过去是一个车间完成所有活,想增加产能就得一直复制这一个车间。现在是流水线,冲压车间就负责冲压,电泳车间就负责电泳。
并且记忆只产生一次,解码器的全局 KV Cache 直接从编码器的最终结果投影出来。DeepSeek V4.1 Flash 的全局 KV Cache 压到了 890 字节/token,降低至 V4 Flash 的 1/4。
这是因为 DeepSeek V4.1 Flash 采用了 CSA2(Compressed Sparse Attention 2),第二代压缩稀疏注意力。
V4 的时候 DeepSeek 使用的是第一代 CSA,到了第二代,可以让不同层之间共享 KV 和索引,也就解决了前面所提到的痛点。
依然是像汽车流水线一样,CSA2 中把这 40 层分成了三个不同的车间,分别为 Full、Reindex 和 Reuse。
Full 负责完整记录,就像传统 Transformer 的每一层一样。Reindex 负责提炼重点,再根据提炼的结果做事。Reuse 则直接照着 Full 的技术抄,连提炼都省了。
虽然说除了第一层用 Full,剩下 39 层全用 Reuse 是最节省成本的做法,但每层关注的重点不同,能力也不同,浅层做的是“ 字面理解”,深层做的是“ 逻辑推理”,它们需要的上下文内容不同。如果全用 Reuse 只会生成没有价值的回答。
去年还是先有车、再修路,今年已经是先修路,再造车。
模型性能强弱、性价比高低,都不是叙事的核心,唯有掌握了入口,才能吸引更多用户。
但梁文锋不是第一个这么做的,姚顺雨的 Hy4 preview 走在他之前。
Hy4 preview 官方技术报告里表示,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和 CodeBuddy、WorkBuddy 这些产品共同设计。
在 163 名内部专家参与的 203 个真实工程任务盲测中,Hy4 preview 平均 2.99 分,GLM-5.3 是 2.92,Kimi K3 是 2.94。
入口的重要性不言而喻,腾讯产品矩阵的优势得以发挥。
DSH 和 WorkBuddy 本质上是一种产品闭环,是整条训练流水线的一部分。
有意思的是,2026 年 7 月 24 日,腾讯撤销大语言模型部和多模态模型部,合并成立基础模型部,姚顺雨统一负责。他将混元多模态的发展重点,放在了 Agent 强相关的多模态理解上,和梁文锋此前对多模态的看法一致。
现如今,梁文锋又在模型上靠拢了姚顺雨,互相学习。
智谱与 Kimi 有类似的闭环吗?
智谱和月之暗面这两家不是没有工具,Kimi 有 Kimi Claw,智谱也有 ZCode、AutoClaw 和 GLM Coding Plan。
但这些工具没办法像 DSH 和 WorkBuddy 那样“ 反哺” 模型。智谱和 Kimi 的工具是后挂的外壳,模型先在合成环境里练好,再做个产品给用户用。
智谱现在把所有精力都放在了模型自进化上。8 月 31 日,在智谱半年度业绩会上,唐杰首次明确表示,GLM-6.0 是一款 Full Self-Training(完全自训练) 模型,与 OpenAI 的 RSI(Recursive Self-Improvement,递归自我改进) 相似。
唐杰表示,从预训练、中训练到后训练,全流程让模型自己训自己,不再靠人写代码、清洗数据、调参、设计实验。人只负责给模型定目标,以及做最后的验收工作。
在 GLM-5.3 上,智谱就已经展示过他们自进化方法的一部分了。GLM-5.3 和 5.2 使用的基座相同,但是性能却大幅提升。
具体情况是这样的,GLM-5.3 建了一套端到端的任务环境合成流水线,Agent 从真实世界的软件工程和终端操作场景收集种子任务,接下来模型自己头脑风暴,生成大量可验证的任务草稿,再构建做题用的 Agent,把这些草稿实例化成具体的可运行环境。
将 Agent 输出的回答进行精炼,根据研究员定义的评分标准,检查并迭代优化任务质量。
最终就产出了数千个多样化、可验证的终端 Agent 环境。GLM-5.3 的长程任务环境数量是 GLM-5.2 的几十倍,而且都是 Agent 自己建的。
月之暗面走的是“ 在自建合成环境里把 Agent 能力练到极致” 的路线,相当于是闭关修炼。
具体做法是通过 AgentENV 来完成模型的训练,这是基于 Firecracker 微虚拟机的分布式沙箱系统,
在 K3 训练期间跑了 5100 万个沙箱,支持暂停、恢复、复制、快照,专门解决长程 Agent 强化学习里“ 任务跑不完、环境容易污染” 的基础设施难题。
Agent 的强化学习训练和普通大模型 RL 不一样。普通 RLHF 就是给模型一个 prompt,模型生成一段回答,打个分,更新参数。环境是无状态的,跑完就完了。
但 Agent 训练不一样。模型要在一个真实的运行环境里干活,一个任务可能跑几十步甚至几百步,持续几分钟到几小时。
如果在干活过程中,模型发现缺少某个依赖,那么它会为了完成任务,自己在沙箱里装个依赖、改个配置文件。
虽然任务完成了,不过这个环境也就改变了,即环境被污染了。那么下一轮训练不能接着用,得重新起一个干净环境。重起的过程大约需要几秒,虽然不长,可大规模训练时就会浪费大量时间。
就像学开车一样,如果你一上来就从科目三开始,那必定会成为马路杀手。所以就需要驾校,准备一个不会有行人和来往车辆的空地,练习起步、上坡和侧方停车。
AgentENV 就是 Kimi 的驾校,让 Kimi 可以在训练时大展拳脚,还不会受到环境因素的影响。
所以智谱和月之暗面不是没有闭环,只是这个闭环没有触达外界,练得再好也是闭关修炼。
DSH 和 WorkBuddy 的是入口,用户在真实环境里干活,数据自然回流,模型在实战里被养大。
梁文锋要抢入口
就在 DeepSeek V4.1 Flash 发布的同时,DSH 也宣布更新到了 v0.1.5 版本。新版为插件作者提供了更多标准化的 UI 扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了 UI 的性能与交互,并持续增加与模型研究前沿深度结合的实验性功能。
DSH 在刚发布的时候,与其说它是一个产品,倒不如说它是一个属于极客的玩具。就连安装都能难倒一大片。
DSH 的理念是一切皆插件,需要用什么插件,DSH 自己安装,用完了再删除。结果就是真正好用的插件,全是社区提供的,包括连 UI 都是。
到了 0.1.5 版本,DSH 已经从“ 框架” 逐渐蜕变成了“ 产品入口”。除了适配 V4.1 Flash 以外,全是终端用户产品功能。
举个例子,0.1.5 版本中,Agent 可以显式交付文件。生成的代码、文档、分析报告直接作为文件出现在侧边栏,用户可以预览、打开、定位到本地文件夹。
以前的 DSH 里,Agent 只能输出文字和代码到回答框里,用户必须得亲自复制粘贴到文件里才行。
不仅如此,新版本还有一个极其实用的功能,叫做“ 支持在保留已有 KV Cache 的情况下更新系统提示词”。
传统 Agent 有个痛点,长会话跑到一半,你想改系统提示词,比如让 Agent 从“ 写代码模式” 切换到“ 写文档模式”,那就必须清掉整个 KV Cache 重新 prefill。
在 1M 上下文的前提下,切换系统提示词,就意味着 Agent 要花几十万甚至上百万 token 去重新规划任务。
所以现有 Agent 产品基本不允许中途改系统提示词,Agent 的角色和目标从会话开始就锁死了。
这就说明,DeepSeek 在有意识地把 DSH 从“ 极客工具” 往前推,让它成为一个面向更多用户的 Agent 产品。核心目的就在于扩大入口,放更多人进来。
现在的 DeepSeek,反而有点像卖剃须刀的吉列。它的刀架不赚钱,甚至免费,它主要挣的是刀片的钱。可真正锁定客户的反而是刀架。
DeepSeek 也一样,想换新模型,复制粘贴一段 API Key 就完事了。但是想换新 Harness,那得需要适应很长一段时间。
所以 DSH 大量优化用户体验,不仅仅是为了继续“ 反哺” 未来的 DeepSeek V4.1 Pro,乃至 5、6、7、8,更是为了抢占入口。
DeepSeek 已经在朝着“ 入口公司” 看齐了。
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App















