中国AI巨龙的「反围剿」:DeepSeek华为芯片集群如何系统性威胁英伟达护城河

2026年9月7日,路透社Breakingviews专栏以一个战意十足的标题发出了最新评论:「China’s AI dragons breathe fire on Nvidia’s moat」(中国AI巨龙吐火,英伟达护城河冒烟)。

这不是情绪化的标题党,而是一个对当下正在发生的系统性变化的冷静描述。

触发这篇评论的事件,是Bloomberg 9月4日报道的一条消息:中国AI实验室DeepSeek计划为其内蒙古1GW数据中心订购至少16万颗华为Ascend 950DT加速器。如果这个订单最终落实,它将成为已知规模最大的华为AI芯片集群——一个装满不是英伟达芯片的巨型AI基础设施。

单独看这个数字,可能只是「中国公司买中国芯片」的常规新闻。但放在2026年全球AI基础设施竞争的背景下,它代表了一个深层的结构性转变:中国AI的算力自主化路径,已经从「探索可能性」进入了「规模化落地」阶段。

这条路,比大多数观察者预期的走得更快。


第一章:出口管制的意外效果

要理解这一切,需要从美国出口管制政策开始。

2022年10月,美国商务部出台了对中国AI芯片的出口限制,将英伟达A100和H100列入管制清单,要求获得许可证才能出口到中国。此后,限制范围持续扩大:针对A800、H800(专为中国市场降档的芯片)的限制,到2023年底也相继实施。到2026年,英伟达在中国市场可以销售的高端AI芯片实际上已经无存。

这个政策的初衷是明确的:通过切断中国AI实验室获取先进算力的渠道,减缓中国AI技术的发展速度,维持美国AI研究的竞争优势。

但政策有一个意想不到的效果:它强制中国AI生态系统加速了算力自主化进程,把本来可能「慢慢解决」的问题变成了「必须立即解决」的战略优先级。

如果英伟达的A100/H100仍然可以随意购买,中国AI实验室的算力路径可能会继续依赖英伟达,华为Ascend的商业化就会更慢、规模会更小。出口管制的「药方」,在短期内确实延缓了中国AI训练能力的扩张;但在中期,它可能加速了中国本土芯片生态系统的成熟。

2023年,华为Ascend 910B以其相对于被限制的A100的性价比开始被部分中国AI实验室采用。2024年,Ascend 910C进入市场,性能进一步提升。2025-2026年,Ascend 950DT的推出标志着华为芯片开始具备承担大规模AI训练工作负载的能力。DeepSeek的16万颗订单,是这条演化曲线的最新数据点。


第二章:16万颗芯片,到底代表多少算力?

让我们把这个数字具体化。

DeepSeek计划在内蒙古建设的数据中心规划算力为1GW(吉瓦),这个规模是极大的——全球目前最大的AI数据中心集群约为100-300MW量级,1GW是业界讨论中的下一代超大规模目标。16万颗Ascend 950DT,如果均匀部署,大约对应500-600MW的芯片算力(其余用于配套基础设施)。

Ascend 950DT的单颗算力(以BF16精度计)与英伟达H100有一定差距——各方评估从「相差20%」到「相差50%」不等,由于中国AI公司的基准测试缺乏透明度,精确数字难以验证。但即使假设每颗Ascend 950DT的有效算力只有H100的60%,16万颗 × 60% ≈ 相当于约9.6万颗H100的算力。

这个等效算力是什么量级?OpenAI训练GPT-4时使用了约2万-3万颗A100(GPT-4时代的旗舰),Meta训练Llama 3 70B使用了约1.6万颗A100。9.6万颗H100等效算力,可以支持训练一个远超当前任何公开模型规模的超大型模型。

当然,现实中训练效率还受到互联带宽、软件栈成熟度等因素影响,华为集群的实际利用率可能低于英伟达集群。但这个量级的数字说明了一件事:中国AI算力的量级问题,已经在很大程度上通过规模弥补了单颗性能差距。

这是「减量替代」逻辑的核心:当你无法买到最好的单颗芯片,你就买足够多的次优芯片,只要软件能充分利用,总算力可以接近。


第三章:DeepSeek的「算法效率」路线与「规模扩张」路线的汇合

DeepSeek在过去一年里以其「用更少算力训练更强模型」的技术路线震惊了业界。DeepSeek-V3和DeepSeek-R1在许多基准测试上与GPT-4o相当甚至更优,但使用的训练算力大约只有OpenAI同等模型的十分之一。

这个成就来自一系列技术创新:混合专家架构(MoE)的高效利用、强化学习训练流程的优化、推理阶段的蒸馏技术,以及为有限算力环境设计的训练策略。

但现在,DeepSeek在算法效率路线的同时,开始叠加规模扩张路线。这意味着什么?

如果同样的训练效率提升,配合10倍或100倍的算力规模,训练出的模型能力将有质的飞跃。DeepSeek-V3在「算法精简 + 有限算力」下已经媲美GPT-4o级别。如果在「算法精简 + 海量算力」的条件下训练,理论上可以达到GPT-6 Astra级别或更高。

这是中国AI基础设施扩张的战略逻辑:不是为了追上当前的英美AI进度,而是建立训练下一代模型的能力。16万颗华为芯片,是为了两年后的模型,而不是今天的模型。


第四章:软件生态——最后也是最难的壁垒

技术分析到这里,我们需要回答一个关键问题:华为芯片的算力量级接近了,但训练大模型还需要软件栈。CUDA生态在训练端的壁垒,在中国市场的语境下是否仍然成立?

答案是:在中国市场,这个壁垒的成立条件正在被逐渐侵蚀。

华为推出了CANN(Compute Architecture for Neural Networks)作为Ascend的软件平台,对标CUDA。CANN目前已经支持PyTorch和TensorFlow的适配层(通过ascend-torch和昇腾扩展),这意味着开发者可以用相对接近CUDA的接口编写Ascend代码。

更重要的是:中国AI生态系统正在主动绕开对CUDA的依赖。百度的PaddlePaddle、阿里的PAI平台、华为自身的MindSpore框架,都是以国产芯片为首选后端构建的,不需要经过CUDA路径。即使DeepSeek的代码库中有CUDA优化,其核心训练框架也已经在做Ascend适配。

换句话说,中国AI生态对CUDA的依赖,不是因为别无选择,而是因为在可以使用英伟达GPU的时候,CUDA是效率最高的路径。一旦无法使用英伟达GPU,这个生态正在积极地向国产软件栈迁移。出口管制加速了这个迁移过程。

这是英伟达CUDA护城河在中国市场面临的最大威胁:这个护城河建立的前提——大量的开发者代码库依赖CUDA——在中国这个「无法使用英伟达」的强制条件下,正在被系统性地拆解。


第五章:「减量替代」的时间线——华为追赶的路有多长?

批评者常常说:华为芯片就算规模再大,性能还是落后英伟达,这个差距无法弥补。

这个批评有一定道理,但忽略了时间轴。让我们看看华为芯片的性能演化:

  • Ascend 910(2019年):主要用于推理,训练能力有限
  • Ascend 910B(2022-2023年):首个被大规模用于中国AI训练的芯片,性能约为A100的60-70%
  • Ascend 910C(2024年):性能进一步提升,部分评估接近H100
  • Ascend 950DT(2025-2026年):被DeepSeek选为16万颗大规模订单的芯片,具体性能数据不完全公开

从910到950DT,约6年时间,华为从「勉强可用的AI训练芯片」演化到「被中国顶级AI实验室选择用于GW级数据中心」的主力芯片。

这条演化曲线是否会继续?受制于台积电代工限制(美国出口管制使华为无法使用台积电3nm/5nm工艺,只能依赖中芯国际的7nm及以下工艺),华为在芯片制造工艺上的差距短期内难以弥合。

但这里有一个关键的分离:制造工艺差距 ≠ 系统级算力差距

芯片系统设计、内存带宽优化、多芯片互联拓扑、封装技术——这些维度上,华为有更大的自主空间。台积电7nm的华为芯片,如果在架构设计上足够精妙,仍然可以在特定工作负载上超越某些台积电5nm的竞争对手。英伟达H100本身就是台积电4nm工艺,但它的成功更多来自NVLink互联架构和软件栈,而不只是最先进的工艺节点。

路透社的评论正确地指出:「即使华为顶级芯片的单颗算力仍不及英伟达上代产品,中国厂商正在通过规模化部署和本土供应链缩小差距」。这里的「缩小差距」,不只是性能差距,还包括供应链可靠性差距——华为芯片不受出口管制,可以根据需要稳定供应;英伟达芯片即使性能更强,在中国也买不到。


第六章:对全球AI格局的含义——「双轨AI世界」正在形成

DeepSeek的16万颗华为订单,加上此前DeepSeek系列模型的一系列技术突破,正在加速一个「双轨AI世界」的形成:

美国轨道:基于英伟达GPU + CUDA生态 + OpenAI/Anthropic/Google模型,提供全球80%以上国家和地区的AI算力和模型能力支持。这条轨道的特点是:技术性能最高、软件生态最成熟、但受出口管制约束,在中国市场基本缺席。

中国轨道:基于华为Ascend + CANN/MindSpore/PaddlePaddle生态 + DeepSeek/通义千问/文心等模型,服务中国国内AI应用需求,并通过出口和国际合作向全球南方国家输出。这条轨道的特点是:技术性能追赶中、成本优势显著、软件生态建设积极、不受西方出口管制约束。

这两条轨道将在未来5-10年共存,并形成各自的生态系统。参与「中国轨道」的公司将不需要接入CUDA,不需要关心英伟达的生态。这意味着,英伟达CUDA护城河的有效范围,正在缩小为「美国及其盟友市场」。

对英伟达来说,这个市场仍然足够大——美国、欧洲、日本、韩国、台湾、澳大利亚等主要AI市场,加起来占全球GDP的约60%。短期内,这个护城河的经济价值并不会因为中国轨道的形成而崩溃。

但长期来看,这意味着英伟达失去了约20-25%的潜在AI基础设施市场(中国市场),而且这个失去是不可逆的——即使未来出口管制放松,中国AI生态已经建立的本土芯片依赖也不会轻易逆转。


第七章:不对称的博弈——中美AI竞争的真实格局

有一个误区值得纠正:很多人把「中美AI竞争」描述为一场双向的全面战争,仿佛中美两国的AI实力正在全线接近。

实际情况更加复杂。

美国的优势领域:顶尖模型能力(GPT-6 Astra、Claude Fable 5.1级别)、训练效率(英伟达GPU集群利用率)、AI应用的商业化生态(Salesforce Agentforce、Microsoft Copilot等)、AI安全和对齐研究(Anthropic、DeepMind等)。

中国的优势领域:成本效率(DeepSeek系列用更少算力训练高性能模型)、快速部署速度(本土监管流程更短)、特定垂直场景(中文NLP、工业AI、智慧城市)、不受出口管制的算力主权。

仍然存在明显差距的领域:中国在制造工艺(台积电级别的先进工艺不可获取)、高端芯片设计生态(EDA工具链仍有差距)、顶尖AI研究人才(全球顶尖AI研究者仍以美国为主要聚集地)上存在差距。

这不是一场简单的「谁更强」的竞争,而是两个生态系统在各自优势维度上的分化演化。中国不会在2028年在所有维度上追上美国AI;但美国AI也不会在2028年在中国市场内保持其当前地位。两件事可以同时为真。


结语:护城河的冒烟,和它意味着什么

路透社的标题说护城河在「冒烟」,不是在「燃烧」。

这个区别很重要:冒烟意味着有压力、有热度,但结构仍然完整。DeepSeek的16万颗华为芯片、中国算力自主化的加速,是对英伟达护城河的真实压力,但这个压力在2026年秋天还没有产生决定性的结构性突破。

英伟达在美国和盟友市场的主导地位仍然稳固;CUDA生态在可以使用英伟达的市场仍然是事实标准;短期内没有任何竞争者能在这个范围内取代英伟达。

但护城河的「烟」,代表了一个不可忽视的长期趋势:全球AI算力基础设施正在沿着地缘政治的断层线分裂成两个独立生态,而在「中国轨道」这个生态里,英伟达的CUDA护城河从根本上不再成立。

对中国AI来说,DeepSeek的16万颗订单是一个宣告:我们不再等待英伟达,我们正在建立自己的路。

对英伟达来说,护城河已经在冒烟。

而冒烟,是燃烧的序章。



附录一:华为Ascend技术路线的深度解析

理解这场硬件追赶战,需要对华为Ascend的技术路线有更深入的认识。

华为在芯片设计上走的是「达芬奇架构」路线,这是完全独立于英伟达CUDA编程模型的不同架构设计。达芬奇架构的核心单元是「AI Core」,专门为矩阵运算优化,类似于英伟达的Tensor Core但实现方式不同。

Ascend 910系列的主要规格:

  • Ascend 910B:峰值算力约256 TFLOPS(BF16),内存带宽约2.0 TB/s,支持HBM2e
  • Ascend 910C:峰值算力约320 TFLOPS(BF16),内存带宽约2.4 TB/s
  • Ascend 950DT:具体规格未完全公开,但DeepSeek的大规模采购意味着性能满足大型模型训练需求

对比英伟达H100:峰值算力约500 TFLOPS(BF16),内存带宽约3.35 TB/s,支持HBM3。

差距是存在的,但有两个重要的补偿因素:

第一,华为的Atlas集群系统使用私有互联协议HCCS(Huawei Cache Coherency System),可以把多颗Ascend芯片连接成高效的训练集群,与英伟达的NVLink形成竞争。在大规模多机集群场景下,互联效率比单颗芯片性能更重要。

第二,中国AI实验室开发了针对Ascend架构的专用优化技术。DeepSeek在发表其训练方法论的技术报告中,提到了大量针对有限内存带宽和计算能力的算法优化,这些优化既适用于有限的英伟达A800,也适用于华为芯片。适应性强的算法,可以部分弥补硬件性能差距。


附录二:中国AI生态系统的全景——不只是DeepSeek

DeepSeek的16万颗订单吸引了最多关注,但中国AI芯片生态的建设远不止DeepSeek一家。

百度:文心大模型团队使用昆仑芯(由百度系投资)和部分华为Ascend,同时也使用了一些英伟达GPU(在出口管制生效前采购的存量)。百度的飞桨(PaddlePaddle)框架专门针对国产芯片优化,是中国使用最广的自研AI框架之一。

阿里巴巴:通义千问(Qwen)系列在多种硬件平台上训练,包括阿里云自研的含光800芯片、华为Ascend,以及部分英伟达GPU存量。阿里开发了「MaxCompute + 飞天」的分布式训练平台,支持混合硬件集群。

字节跳动:豆包(Doubao)团队对Ascend的采用相对谨慎,仍然大量依赖英伟达GPU存量,同时在布局海外数据中心(新加坡、马来西亚)来突破算力限制。

中小型AI实验室:大量中小型AI公司面临算力困境,不得不依赖国产芯片。这反而成了国产芯片商业化的重要驱动力,「别无选择」带来了真实的市场规模。

这个全景说明:中国AI算力自主化是多条路线并行的系统性工程,不只是一个DeepSeek的单点突破,而是整个生态系统在出口管制压力下的集体适应。


附录三:对全球AI公司的采购策略影响

DeepSeek华为订单的意义,不只局限于中国市场。它可能对全球AI公司的芯片采购策略产生影响:

对英伟达的直接影响:中国市场彻底失去(英伟达已基本退出),这约占英伟达数据中心收入的15-20%。短期内,这个缺口被美国和欧洲市场的旺盛需求弥补,英伟达的总收入并未受损。但中长期,中国市场的技术路线与英伟达解耦,英伟达的软件生态在这个市场从根本上失去了价值。

对AMD的战略机会:AMD在中国市场也受出口管制限制,但比英伟达受到的限制稍少(A800等降档产品曾出口,目前也基本停止)。AMD的机会更多在美国/欧洲市场,以低于英伟达的价格竞争部分AI训练市场份额。

对英特尔的影响:英特尔的Gaudi 3在中国曾有一定出货(相对较轻的管制限制),但随着政策收紧,也基本停止。英特尔目前的AI芯片战略主要聚焦美国/欧洲市场。

对云厂商的影响:AWS、Azure、Google Cloud在中国运营受限,其AI算力服务主要面向非中国市场。这实际上使三大云厂商与中国市场的竞争隔离——他们不需要考虑华为Ascend的算力竞争,只需关注英伟达主导的美国/欧洲市场格局。


附录四:地缘政治学视角——「算力版图」的地理分割

有一个更宏观的框架,可以把DeepSeek的16万颗华为芯片订单放入其中:「算力版图」正在沿着地缘政治边界分割。

这不是第一次技术资产沿政治边界分割:互联网有「防火长城」,半导体供应链有「可信供应商」名单,5G基础设施有「华为是否被允许」的争论。AI算力是下一个被地缘政治标注的技术战略资产。

从「算力版图」的视角来看,世界正在形成三个主要区域:

「美国阵营」:美国、英国、加拿大、澳大利亚(五眼联盟核心)+ 欧盟核心国家 + 日本韩国(半导体盟友)。这个区域使用英伟达/AMD/英特尔芯片,基于CUDA生态,接受美国出口管制规则的约束。

「中国阵营」:中国大陆 + 部分通过「双循环」战略与中国AI生态深度整合的国家(部分东南亚、中东、非洲国家)。这个区域使用华为Ascend + 国产AI框架,访问DeepSeek/百度/通义千问等模型,不受西方出口管制约束。

「中间地带」:绝大多数全球南方国家,既与美国有合作,也与中国有联系,目前倾向于「最低成本最优解」——中国算力云服务(如DeepSeek API)可能因价格优势渗透这些市场,而非美国的Azure/AWS。

英伟达的护城河,在美国阵营是稳固的;在中国阵营是事实上已经消失的;在中间地带,则取决于价格和访问便利性的竞争——这正是「算力版图」分割对英伟达最不确定的战场。


附录五:华为Ascend的软件生态建设——从CANN到MindSpore的全栈布局

软件生态的建设往往是芯片商业化成功与否的决定性因素。华为深刻理解这一点,因此在推出Ascend硬件的同时,构建了一套完整的软件生态体系。

CANN(Compute Architecture for Neural Networks):这是华为对标CUDA的底层计算平台,为Ascend芯片提供编程接口和算子优化库。CANN 7.0已经支持了大量深度学习算子,并通过适配层支持PyTorch和TensorFlow。开发者可以通过PyTorch的torch_npu扩展直接调用Ascend算力,迁移成本相比直接改写CANN代码大幅降低。

MindSpore:华为自研的深度学习框架,内置了对Ascend架构的深度优化,包括自动并行、混合精度训练、算子融合等。MindSpore是中国高校和科研机构使用率最高的国产AI框架,在学术界的渗透有助于培养未来面向Ascend开发的工程师群体。

ModelArts:华为云的AI开发平台,提供从数据标注到模型训练、部署的全流程服务,底层对接Ascend芯片和CANN软件栈。对于不需要深入底层优化的企业用户,ModelArts提供了接近英伟达A100集群使用体验的「开箱即用」解决方案。

这套软件生态与CUDA相比仍有差距:开源社区规模更小、算子覆盖不完整、特定高性能优化(如FlashAttention、PagedAttention等被广泛使用的CUDA优化算法)的Ascend适配进度参差不齐。但这个差距的方向是收窄的,而不是扩大的。

更关键的是:对于在出口管制后别无选择的中国AI公司,软件生态的「不够完美」是一个可以通过工程努力修复的问题,而算力「买不到」是一个无法修复的问题。这就是为什么,即使华为的软件生态目前在绝对意义上不如CUDA,中国AI生态仍然在积极迁移——因为这是他们「能做到」的那个选项。

华为Ascend软件生态的成熟度,将是决定「中国AI轨道」发展速度的关键变量之一。值得持续关注。


附录六:投资视角——这场博弈如何影响资本配置

中美AI算力竞争的深化,对全球科技投资格局有直接影响,主要体现在以下几个维度:

英伟达的估值模型需要重新校准:如果全球AI算力市场的20-25%(中国市场)正在系统性地从英伟达迁出,英伟达的总体可寻址市场(TAM)需要相应调整。这不意味着英伟达的股价应该下跌25%,因为英伟达在剩余市场的份额可能继续增长;但长期增速预期需要包含中国市场缺失的影响。

华为供应链的投资机会:DeepSeek16万颗订单意味着华为Ascend的量产需求巨大。供应华为Ascend芯片封装、测试、散热、电源管理等环节的中国本土供应商,将迎来稳定且持续的订单增长。这类企业的投资价值在中国资本市场开始获得更多关注。

中国AI应用公司的算力成本降低:随着华为Ascend量产规模扩大、供应链成熟,国产AI芯片的采购价格有望逐年下降,对中国AI应用公司来说意味着算力成本结构的长期改善,有利于AI商业化盈利能力。

全球南方市场的AI基础设施投资:中国算力云服务(以华为云、阿里云、字节为代表)在全球南方国家的渗透,可能开辟一个「不需要通过英伟达」的新市场,这个市场的规模和增速值得持续追踪。


最后的思考:英伟达的危机感与华为的使命感

这场竞争有一个被低估的心理因素:华为的算力自主化,不只是一个商业选择,而是一个关乎国家战略的使命。

英伟达的每次芯片迭代,是为了市场份额和股东回报。华为的每次Ascend迭代,是为了证明中国可以在不依赖美国技术的前提下建立完整的AI基础设施——这是一个关乎「技术主权」的问题,不只是一个关乎利润率的问题。

使命感驱动的竞争者,往往比利润驱动的竞争者更难击败。

这是DeepSeek的16万颗华为订单之外,英伟达需要认真思考的更深层含义。

参考资料

  1. China’s AI dragons breathe fire on Nvidia’s moat - Reuters Breakingviews,2026-09-07
  2. DeepSeek said to order at least 160K Huawei AI accelerators for new data center: report - MSN/Bloomberg,2026-09-04
  3. DeepSeek’s 160,000-chip Huawei order puts PRC law over every API query - MSN,2026-09-05
  4. Nvidia is bolstering support for Chinese open AI models as it warns of White House crackdown - CNBC,2026-08-27
  5. NVIDIA (NVDA)’s $20 Billion Groq Bet Goes Live This Year With New AI Racks - Yahoo Finance,2026-09-06