2026年9月4日,彭博社(Bloomberg)报道,中国AI实验室DeepSeek正准备向华为订购至少16万枚AI加速器,用于在内蒙古建设新数据中心。

16万枚。这个数字,比很多人想象的要大得多。


数字背后的规模感

为了理解这个订单的量级,我们需要一些参照。

在2022年,当时全球最大的AI训练集群之一,是Meta建设的”Research SuperCluster”,配备了约16000块NVIDIA A100 GPU。到2024年,Elon Musk的Colossus项目以10万块H100宣告”AI超算基地”进入新时代。

DeepSeek订购的16万枚华为Ascend,几乎是Colossus的1.6倍,是Meta那个里程碑集群的10倍。

当然,不同芯片的算力无法直接比较。华为最新一代Ascend 910C的峰值算力大约是NVIDIA H100的60%-80%(依任务类型不同),最新规格Ascend 910D据某些行业报告称已接近H100的算力水平。如果这次订购的是高端型号,16万枚所代表的聚合算力将是一个真正意义上的”算力巨兽”。

在内蒙古的冬天,计算机需要的冷却能源,可以由自然气温提供相当程度的辅助——这是DeepSeek选择内蒙古建设新数据中心的可能原因之一。内蒙古还是中国风电和光伏装机量最大的省区之一,符合AI数据中心向绿色能源靠拢的长期趋势。


为什么是华为Ascend

在美国出口管制实施之前,中国AI实验室主要依赖NVIDIA的GPU——H100、A100是标准配置。DeepSeek在训练早期版本的模型时,也大量使用了A100集群(据报道训练V3时使用了约2048块H800)。

2022年以来,美国商务部的出口管制范围不断扩大:先是A100、H100,后是降级版的A800、H800,再到最新的Blackwell系列,几乎每次”降级版”刚刚被允许出口,下一轮管制就随之跟上。2024年底,美国出口管制的范围已经覆盖了几乎所有高性能AI芯片向中国的销售。

在这个背景下,中国AI生态的硬件依赖问题变得极其紧迫:不是”以后会受限”,而是”已经受限,且会持续收紧”。

华为Ascend系列在这个时候成为中国AI实验室最现实的替代选项。

但”现实可行”和”技术同等”之间,仍然存在差距。

华为Ascend 910系列的生态成熟度不及NVIDIA CUDA生态——大量深度学习框架、优化工具和模型代码,都是以CUDA为默认开发环境的。从CUDA迁移到昇腾(Ascend的编程框架CANN,Compute Architecture for Neural Networks)需要大量工程投入。

这正是DeepSeek这次订购的隐含信息:16万枚意味着他们认为这个迁移成本是可接受的,华为Ascend的生态已经足够成熟,可以支撑大规模生产部署。


算力自主化的两条路

中国AI算力的自主化,从技术路线上看有两条路在同步推进:

路线一:继续使用NVIDIA架构(通过灰色渠道)

这条路确实存在。从公开报告来看,2023-2024年间,相当数量的NVIDIA H100通过第三方中间商流入中国,包括绕道东南亚国家的间接出口。美国商务部正在持续收紧对这些渠道的监控,但完全堵死并不容易。

然而,这条路有明显的脆弱性:随时可能被切断,且数量有限,无法支撑DeepSeek这种规模的数据中心建设。

路线二:构建本土替代生态(华为+中芯)

这条路的核心挑战是半导体制造:中国目前最先进的规模化量产节点是中芯国际(SMIC)的7nm N+2,而NVIDIA的H100基于台积电的4nm工艺。工艺差距意味着相同功能的芯片,华为版本需要更大面积(更贵)或运行在更低频率(更慢),且功耗更高。

但”更贵更慢功耗更高”并不等于”不可用”。如果算力供应的确定性比边际效率更重要,本土路线就具备了独立的战略价值。

DeepSeek的16万枚订单,是在显示他们选择了第二条路——或者说,在无法依赖第一条路的情况下,必须把第二条路走通。


DeepSeek的独特位置

DeepSeek在中国AI格局中处于一个特殊位置。

它是量化对冲基金幻方科技(High-Flyer Quant)的内部AI项目,后来独立运营。幻方科技的量化交易背景意味着两件事:

  1. 对算力效率有极高要求(量化策略对计算延迟极度敏感)
  2. 有足够的资本支撑大规模基础设施建设(16万枚华为Ascend的价格,以当前市场估算,可能在30-80亿人民币级别)

DeepSeek的V3和V4系列模型因其”用更少算力实现顶级性能”而闻名——这不是营销话术,而是技术上可验证的成就:V3训练用了约558万H800 GPU小时,相当于训练同等规模GPT-4级别模型所需算力的1/10。

这种算力效率,正是他们可以在国产芯片相对劣势的条件下追赶的底气。如果华为Ascend的算力是NVIDIA H100的70%,但他们的模型训练效率比同类对标高出2倍,综合下来,他们仍然可以以更低成本实现相同的训练目标。


内蒙古数据中心的地缘意义

数据中心的地理位置,在AI时代不只是个工程问题,也是政策问题。

内蒙古是中国”东数西算”战略的重要节点之一——这个战略旨在将东部密集的算力需求,通过网络连接到西部和北部的低成本、低温、可再生能源丰富地区的数据中心。

选择内蒙古,意味着DeepSeek的这个集群会深度嵌入中国国家数字基础设施战略。这不只是一家私营AI实验室的技术选择,也与政策协调有关。

值得注意的是:华为Ascend芯片目前不受出口管制,因为它是中国本土研发生产的——但其制造依然依赖中芯国际的成熟制程节点,以及EUV光刻机无法获取后的替代方案。这个产业链的完整性和可持续性,仍是一个技术上悬而未决的问题。


算力自主化的历史参照

算力的国产化替代,不是中国第一次面对这样的挑战。

在高性能计算(HPC)领域,中国曾经依赖NVIDIA和Intel的处理器运行天河、神威等超算。2016年天河二号(Tianhe-2)被美国实施出口管制后,中国开发了基于申威(Sunway)架构的神威·太湖之光(Sunway TaihuLight),并用它拿下了TOP500超算榜单第一。

这一历史说明:出口管制在短期内会造成痛苦,但长期而言往往反而加速了本土替代的建设。中国的算力自主化,在2022年出口管制大幅收紧之前就已经在推进,管制只是让这个优先级变得更高、更紧迫。

DeepSeek的16万枚华为Ascend订单,或许就是这个历史进程在AI时代的一个里程碑时刻。


两个AI生态的分叉

这次订单的深层含义,是全球AI生态正在向两个不同的技术栈方向分叉:

NVIDIA CUDA生态(美西方主导):

  • 覆盖了绝大多数现有AI训练和推理的工具链
  • 拥有最大的开发者社区和最成熟的优化库
  • 但受地缘政治因素限制,对中国AI的供应链面临不确定性

华为CANN/Ascend生态(中国主导):

  • 工艺制程不及台积电4nm,但产能受自主控制
  • 生态尚在成熟中,但政策支持力度极大
  • 随着DeepSeek等顶级实验室的投入,迁移工具和优化库的完善速度会加快

历史上,不同技术栈之间的竞争,常常是由”有没有重量级用户”决定的。DeepSeek作为全球模型排行榜的顶级选手,选择在华为Ascend上大规模押注,会带动整个中国AI生态更快向这个方向聚拢。


我们在见证什么

16万枚华为Ascend的订单,是一个数字,也是一个信号。

它说明:中国AI实验室已经下定决心,在本土硬件上走出独立的算力路线。它说明:华为Ascend的生态已经成熟到可以支撑顶级AI实验室的规模化部署。它说明:内蒙古正在成为下一代中国AI基础设施的重要地理节点。

这个故事还没有结局。16万枚Ascend能否支撑DeepSeek下一代模型的训练需求?华为的芯片性能差距能否通过软件优化弥补?中国AI在算法效率上的领先,能否在更长时间内对冲硬件性能的差距?

这些问题,将在未来几年的基准测试和实际产品中找到答案。

但有一点几乎可以确定:这次订购之后,所谓”AI算力完全依赖NVIDIA”的说法,对于中国AI生态来说,正在变成过去时。


来源参考

  • Bloomberg(2026-09-04):《DeepSeek Said to Order at Least 160K Huawei AI Accelerators for New Data Center》(经MSN转载)
  • Reuters(2026-08-03):《DeepSeek’s new AI model is by far the cheapest of well-known models to run》
  • CNBC(2026-08-27):《Nvidia is bolstering support for Chinese open AI models as it warns of White House crackdown》