(本文作者为 影子备忘录,钛媒体经授权发布)
文 | 影子备忘录
国庆假期前一天,DeepSeek 放出了一条一则消息:正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、高性能计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
如果你只把这当作一次普通的“ 国产适配”,那可能会错过这件事真正的分量。
过去几年,国产芯片适配大模型的新闻并不少见,但大多是“ 能在上面跑起来” 的层面,比如验证兼容性,刷个适配公告,然后就没有然后了。
不过这次不一样,因为 DeepSeek 把自己在英伟达平台上打磨成熟的那套工具链,几乎完整地、成体系地搬到了昇腾上,而且关键测试中的计算与通信性能已经接近硬件上限。
这不是一次适配,这是一次搬家。
算力焦虑的尽头,是别无选择
要理解 DeepSeek 为什么在此时选择华为,得先理解这家公司正面临什么。
梁文锋在今年 7 月的一场闭门投资者会议上,说了一句非常坦率的话:中美 AI 能力之间的差距,包括人才、模型性能和应用等都可以归结为一个变量,算力资源。
他透露 DeepSeek 目前运营着约 2 万块英伟达 H 系列同等算力的芯片,但无法采购到足够的硬件来训练最大规模的前沿模型。
他估算,训练顶级大模型可能需要约 5 万颗英伟达 GB300 芯片,若采用华为昇腾 950,则可能需要约 20 万颗。
“ 今年能花出去 200 亿人民币,就说明我们的采购团队表现出色了。要花到这个数实在太难了。芯片买不到,价格还高。”
这段话里有两层意思。第一层是外部供应的不确定性,主要是出口管制持续收紧,英伟达对华特供芯片的供应既不充足也不稳定。
第二层是即便买到了,成本也高得令人窒息。DeepSeek V4-Pro 的 API 输入价格低至 0.25 元/百万词元,而 GPT-5.5 Pro 加权平均输入价格为 30 美元/百万词元,两者相差超过 700 倍。
这种极致性价比的定价策略,要求基础设施成本必须被压到极限。而英伟达芯片的采购价格摆在那里,再怎么优化,成本曲线也降不下来。
相比之下,华为昇腾新款推理芯片的采购价格仅为英伟达的四分之一,单卡算力却比英伟达对华特供版提升了 2.87 倍。
梁文锋对华为昇腾 950 超节点的评价是:“ 在性能和价格上完全可以平替英伟达的 GB200 和 GB300。”
这就不难理解为什么 DeepSeek 把使用华为等国产芯片训练大模型列为重要战略方向。
据彭博社报道,DeepSeek 已向华为订购了 16 万颗昇腾 950DT 芯片,用于其位于内蒙古的 1GW 数据中心。梁文锋甚至说,这项工作“ 必须成功”。
TileLang 这步棋,走在了所有人前面
但仅仅因为“ 买不到英伟达芯片” 就去拥抱华为,这个叙事太单薄了。真正值得拆解的,是 DeepSeek 选择合作的技术路径。
答案藏在 TileLang 里。
这家公司从训练 V3 模型开始,就在做一件很多同行没有做的事情,他们正在用自研的 TileLang 高级语言来写算子,而不是直接调用 CUDA。
TileLang 的设计思路是:让开发者用更简洁的高级语言编程,同时通过编译器优化达到接近硬件性能上限的执行效率。
目前,DeepSeek V4 系列模型训练中大部分算子已经基于 TileLang 实现。
这也意味着 DeepSeek 在英伟达平台上构建模型时,并没有把自己和 CUDA 生态绑死。TileLang 扮演了一层抽象,往上承接模型训练的逻辑,往下对接芯片的底层指令。
当这层抽象被移植到昇腾平台时,对昇腾 Ascend C 底层指令进行封装,开发者的代码逻辑几乎不需要重写。
从目前的情况来看,梁文锋确实把这条路走通了。华为 950 超节点“ 四颗芯片的算力相当于一颗英伟达芯片”,双方在芯片本身仍存在“ 四倍加两年” 的差距,但生态适配的障碍已经被跨过去了。
对比一下 OpenAI 和 Anthropic 的做法,这条路径的独特性就更清楚了。
OpenAI 选择的是自研芯片,他们与博通合作开发了 Jalapeño 推理加速器,同时与 Cerebras 签署了超过 200 亿美元的算力服务协议,走的是“ 定制硬件+多元供应商” 的路子。
Anthropic 则在模型性能上持续加码,Sonnet 5.5 在编码基准上已经超越了自家旗舰 Opus 5.5,同时成本只有 GPT-6 Sol 的五分之一。
两家美国头部公司,一家向左往硬件深处走,一家向右往模型效率走,但都没有走“ 把一个成熟的软件工具链跨平台移植” 这条路。

DeepSeek 走的是第三条路。它的赌注在于:软件工具链的可移植性,可能比芯片本身的性能差距更重要。
当 TileLang 在昇腾上跑通,所有使用 TileLang 的开发者,理论上都可以在昇腾上构建模型,而不需要重新学习一套编程范式。
华为也将本次联合创新的成果在 CANN 社区开源,覆盖大 EP 低延时推理部署、单卡/单机部署、大规模训练、超长文本 KVcache 池化与 Agentic RL,开发者拿到的是可以直接用的实践方案。
不只是 DeepSeek 一家的选择
如果把视角拉远一些,会发现 DeepSeek 的决策并非孤立事件。
智谱 AI 在今年 1 月联合华为开源了 GLM-Image,这是首个完全基于国产芯片 (昇腾 Atlas 800T A2) 和昇思 MindSpore 框架完成全流程训练的 SOTA 多模态模型。
到了 2 月,智谱完全使用华为昇腾 910C 芯片训练的 7440 亿参数 GLM-5 模型,在“ 人类最后的考试” 基准测试中登上了榜首,全程没有使用任何英伟达 GPU。
阿里通义千问、字节豆包、百川智能等头部玩家,都在同步推进国产算力适配。
彭博行业研究的一项调查显示,中国企业计划在未来 12 个月内将 46% 的 AI 加速芯片预算用于采购国内芯片,远高于目前的 30%。
深圳已经投运了基于昇腾 910C 的 1 万卡 AI 算力集群,预约率达到 92%。
这不是一两家公司的孤勇,而是一个行业在供应链约束下的集体战略调整。
区别在于,DeepSeek 这次做的是“ 从根上” 解决问题,而不是简单地让模型能在国产芯片上跑,这是在国产芯片上构建一套完整的、从编译工具到通信库的基础设施。
华为向 DeepSeek 提供的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换的 Scale-up 网络和 256K 卡两层交换的 Scale-out 网络,兼顾超低时延推理与前沿基座模型的大规模训练需求。
DeepSeek 团队开发的 DeepEP 通信库,实测互联带宽达到 Dispatch 375 GB/s、Combine 347 GB/s,已经接近硬件上限。
这些数字说明,至少在超节点这种大规模并行计算的场景下,昇腾平台的通信效率已经达到了可用的水平。
软件生态才是真正的护城河
回过头来看,DeepSeek 选择在这个时间点与华为深度合作,还有一个容易被忽略的考量。
英伟达的 CUDA 生态之所以牢固,核心不在于芯片本身,而在于十余年积累的数百万开发者、成熟的工具链和丰富的代码库。
换成硬件容易,换成生态极难。梁文锋对此的判断是:CUDA 的护城河正在“ 迅速瓦解”,中国 AI 芯片产业正面临取代外国硬件的“ 历史性机遇”。
他预测,在一年之内,实际部署情况将颠覆市场上认为国产芯片生态“ 不可用或难以使用” 的看法。
这话听起来像是乐观主义者的宣言。但从技术角度看,他手里确实有几张牌。
TileLang 本身就是一张牌。它的定位是比 CUDA 更简单的高级语言,能显著提高开发效率、简化代码逻辑,同时不损失硬件性能。
如果 TileLang 的昇腾版本能够吸引足够多的开发者使用,那它就构成了一条绕过 CUDA 的通道,最终的结果是开发者不需要学 CUDA,只需要学 TileLang,就能在两种芯片平台上部署模型。
DeepSeek 把 TileLang 昇腾版本开源,并明确表示希望“ 对更多 AI 芯片建立高可用软件生态起到示范作用”,这背后的意图再清晰不过了。
另一张牌是 DeepSeek 自身开源模型的号召力。DeepSeek V4 系列是目前全球开源大模型中最受关注的之一,开发者基数庞大。
当这些开发者习惯了用 DeepSeek 的模型和工具链,迁移成本就自然降低了。
而如果昇腾平台能够提供与英伟达平台“ 一一对应” 的组件,迁移就变成了换一个`pip install`的事。
当然,乐观归乐观,现实中的挑战也不容回避。
梁文锋坦承,华为的产能是当前最主要的瓶颈。华为昇腾 950DT 的年产量仅有几十万颗,DeepSeek 那笔 16 万颗的订单可能需要长达一年才能交付。
华为自身也承认,由于产能受限、国内需求旺盛,下一代昇腾 900 系列将主要面向中国市场供应,暂不会全面推向海外。
产能问题不解决,生态的雪球就滚不起来。
写在最后
站在 2026 年秋天回看,DeepSeek 与华为昇腾的合作,与其说是一个“ 去英伟达化” 的故事,不如说是一个关于“ 选择权” 的故事。
过去几年,中国 AI 公司在大模型训练上几乎只有一条路:买英伟达芯片,用 CUDA 生态,在既定的游戏规则里竞争。
出口管制收紧之后,这条路越来越窄,成本越来越高。
DeepSeek 的选择是与其在一条越来越窄的路上挣扎,不如和芯片厂商一起,把第二条路修出来。
至于这条路修得怎么样,现在还不好下定论。
TileLang 能否成为真正的“ 中国版 CUDA” 的雏形,昇腾的产能能否跟上需求,超节点方案在实际训练中的稳定性如何,这些都需要时间检验。
但至少有一点是确定的:当一个行业最顶尖的模型公司愿意把自己最核心的工具链,成体系地移植到一个新的硬件平台上,并且公开宣称“ 性能接近硬件上限” 的时候,这条路就不再只是一个备选方案了。
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App
















