华为昇腾910C+DeepSeek V4 Pro:出口封锁下,中国AI技术栈正在走向完整自主
【系统时间注入】当前北京时间:2026-08-19 08:30 CST
一千片国产芯片,完成了一件外界认为不可能的事情。
2026年8月18日,专注中国科技报道的媒体机构Technode Global发布了一篇报道:DeepSeek V4 Pro模型在至少1000片华为昇腾910C芯片集群上完成了全参数后训练(full-parameter post-training)。这句话看似技术性,但它背后隐含的含义,对理解中美AI技术竞争的走向极为重要。
理解这件事的重量,需要先理解一个背景:大型语言模型的后训练是整个AI开发流程中最依赖高性能芯片的环节之一。在业界的普遍认知中,训练顶级AI模型需要英伟达H100或H200这样的旗舰GPU芯片——这也是美国商务部在多轮出口管制中重点限制对中国出口的目标品类。
华为昇腾910C是国产AI芯片中性能最接近H100的产品,但业界对于它能否完成真正大规模的前沿AI训练,始终有疑虑。这次DeepSeek的实际部署,提供了一个可核实的先例:在被大规模限制进口英伟达芯片的条件下,中国最顶级的AI实验室之一,已经能用国产芯片训练出同样在国际上有竞争力的顶级模型。
一、DeepSeek V4 Pro的技术背景
要理解这次事件的意义,需要先了解DeepSeek V4 Pro这个模型本身。
DeepSeek是由深度求索人工智能公司开发的系列AI模型,在2025年至2026年间以多个突破性成果引发国际关注。DeepSeek V3在2025年底发布时,在多项基准测试上与OpenAI和Anthropic的旗舰模型持平,但训练成本据称只有竞争对手的几分之一,这引发了国际AI界对「高性能低成本训练」的广泛讨论。
DeepSeek V4 Pro是在V3基础上的进一步升级,于2026年8月前后发布。它在API定价上做出了大幅调整:据Xenospectrum 2026年8月17日的分析,DeepSeek于8月17日引入高峰/非高峰时段计费,V4 Pro输出token在高峰时段定价为每百万token 3.96美元,较此前版本上涨355%,是其最便宜模型的14倍以上(Forbes,2026-08-18报道)。这个价格变化本身说明了两件事:一是模型能力有了显著提升,支撑更高的定价;二是训练成本在增加,反映了国产芯片相比英伟达芯片仍然存在的效率差距。
Xenospectrum的报道指出,DeepSeek V4 Pro的峰值推理定价为每百万输出token 3.96美元,在高峰时段比之前版本上涨了355%。这个数字说明,即便使用国产芯片完成了训练,其成本结构仍然高于使用英伟达芯片的竞争对手——差距存在,但已经不是「无法完成训练」的差距,而是「成本偏高」的差距。
这个区别至关重要。
二、昇腾910C:从「备选方案」到「可用技术栈」
华为昇腾芯片的发展历史,是一部被出口管制加速的本土化故事。
在美国开始对华为实施芯片出口限制之前,华为的AI芯片研发是在英伟达竞争压力下进行的,目标是「能用就行」。限制实施之后,昇腾的战略地位急剧上升——它不再只是「备选方案」,而是唯一选择。这种竞争压力的变化,带来了资源投入的快速增加和产品迭代的加速。
昇腾910C是昇腾系列的最新主力芯片,据业界评估,其单卡FP16浮点计算性能约为英伟达H100的70%到80%,但在与英伟达生态系统的软件兼容性上有明显差距。由于深度学习框架(如PyTorch、TensorFlow)在历史上都是围绕英伟达CUDA生态构建的,在昇腾上运行这些框架需要额外的适配工作,这带来了额外的工程成本和调试难度。
但DeepSeek的这次训练结果证明:这些困难是可以克服的。一千片昇腾910C集群完成的全参数后训练,意味着DeepSeek的工程团队已经解决了昇腾与主流深度学习工作流之间的兼容性难题,并且建立了能够支持大规模分布式训练的技术栈。
这不是小事。分布式训练中的通信效率、显存管理、故障容错,都是极其复杂的工程问题。用一个完全不同于英伟达CUDA的芯片生态来解决这些问题,需要大量的底层适配工作。DeepSeek选择了这条更艰难的路,并且——至少初步地——完成了它。
三、中国AI技术栈的完整图谱
要理解DeepSeek+昇腾的意义,需要把它放在更完整的中国AI技术栈图谱里来看。
一个完整的AI技术栈,从底层到应用层,大致包括:
算力层:训练芯片和推理芯片。中国在这一层有华为昇腾、寒武纪、燧原科技等国产芯片,但与英伟达的差距仍然是最大的——不只是单卡性能,更重要的是完整的软件生态(CUDA、cuDNN、Nsight等)积累了多年,国产替代品在这方面还处于追赶阶段。
框架层:深度学习框架。百度的飞桨(PaddlePaddle)、华为的昇思(MindSpore)是主要的国产框架,但在全球开发者社区的覆盖面上,仍然远不如PyTorch。DeepSeek的成功部分得益于它在昇腾上实现了对主流框架工作流的兼容,而不是完全依赖国产框架。
模型层:基础大语言模型。这一层是中国发展最快的一层。DeepSeek系列、通义千问(阿里巴巴)、文心系列(百度)、混元(腾讯)、Kimi(月之暗面)等,在关键基准测试上已经能与英美顶级模型竞争。这是中国AI技术栈中,目前与全球最顶尖水平差距最小的层次。
应用和推理层:面向实际业务场景的AI应用和推理服务。字节跳动、阿里巴巴、腾讯、百度等公司在这一层有大量部署,而且由于直接面向中国的庞大应用市场,这一层的商业化已经相当成熟。推理成本问题(国产芯片推理效率偏低)是目前这一层最大的挑战。
这个图谱告诉我们:中国AI技术栈最薄弱的环节在算力层的芯片,最强的环节在模型层。DeepSeek选择用国产芯片训练前沿模型,是在最薄弱的环节进行压力测试——而结果显示,压力测试初步通过了。
四、出口管制的意外后果:「倒逼效应」正在落地
美国持续升级的芯片出口管制,从战略初衷来说,是为了延缓中国AI能力的发展速度,保持美国在前沿AI技术上的领先。从这个目标来看,管制是否成功?
答案是复杂的。
短期确实造成了明显阻碍。 中国AI实验室在获取最新一代英伟达芯片(H100、H200、GB200)上面临严格限制,这使得大规模训练的算力成本显著上升,某些类型的训练实验无法以理想的规模进行。DeepSeek V4 Pro的定价涨幅,部分反映的就是这种算力成本上升。
但中期效果出现了「倒逼效应」。 当获取英伟达芯片成为不可能,中国的AI生态系统不得不更快地在国产替代芯片、优化的训练算法、高效的分布式系统上投入资源。这种「被迫的技术自主化」,在短期内确实增加了成本,但在中期内反而加速了独立技术路线的成熟。
这个逻辑并不是新发现。历史上,技术封锁引发被封锁方加速自主研发的案例有很多:从苏联时期到1990年代的中国航空工业,技术封锁往往在短期内造成困难,但在中期内催生了具有独立路线的技术体系。这些独立路线不一定优于被封锁的原始技术,但它们的存在本身就改变了战略博弈的格局。
DeepSeek用昇腾910C训练前沿模型,是2026年中国AI技术栈「倒逼效应」落地的最直接证据之一。
五、技术细节:全参数后训练意味着什么?
值得在这里专门解释一下「全参数后训练」这个技术细节,因为它比通常报道中的「大规模训练」含义更精确,也更能说明问题。
AI模型的开发通常分为两个阶段:预训练(pre-training)和后训练(post-training)。
预训练是用海量文本数据训练模型的基础能力,这是最消耗算力的阶段,通常需要数百到数千张高端GPU持续训练数周到数月。DeepSeek V4 Pro的预训练是否也使用了国产芯片,Technode的报道没有明确说明。
后训练包括有监督微调(SFT)、人类反馈强化学习(RLHF)等步骤,让模型从「会说话」变成「按照人类期望说话」。「全参数后训练」意味着,在后训练阶段,模型的所有参数都参与更新,而不是只更新部分参数(参数高效微调的常见方式)。这需要更多的显存和算力,同时也能产生更完整的模型对齐效果。
用一千片昇腾910C完成全参数后训练,说明昇腾在大规模分布式训练的通信效率和显存管理上已经达到了可以应对生产级需求的水平。这不是实验室演示,而是真实的生产训练流程。
这个技术细节的重要性在于:后训练是目前AI模型能力差异化最重要的环节之一。OpenAI和Anthropic在后训练技术上的持续投入,被认为是他们产品质量领先的关键原因之一。DeepSeek能够在国产芯片上完成全参数后训练,意味着它在这个关键环节上的技术能力不再受制于芯片供应链。
六、第三层洞察:中国AI技术栈的战略意义超越商业竞争
在所有关于中国AI技术栈的讨论中,有一个维度经常被商业分析遮蔽:这件事的战略意义,超越了单纯的商业竞争范畴。
一个完整、自主的AI技术栈,对中国来说不只是商业利益,而是「战略自主性」的一部分。在AI被广泛认为将成为未来国际竞争关键要素的背景下,拥有从芯片到模型到应用的完整技术链条,意味着:
不受外部供应链中断风险影响。 如果明天美国进一步收紧出口管制,甚至切断对中国的所有AI芯片供应,一个已经建立完整国产技术栈的生态,能够在阵痛期后继续运转。反之,高度依赖进口芯片的AI生态面临的断供风险是存在性的。
在全球AI治理规则制定中有更大话语权。 目前,全球AI治理的主要讨论框架(欧盟AI法案、G7的广岛AI原则、美国的AI行政命令等)基本由西方国家主导。中国需要建立独立的、在国际上可信的AI技术和产品,才能在这个规则制定过程中有实质性的参与能力,而不只是接受规则。
为「一带一路」沿线国家提供替代性AI基础设施选项。 这是一个很少在商业报道中提及、但在地缘战略层面极为重要的维度。当美国主导的AI技术栈带有出口管制限制和潜在的「道德标准」附加条件时,能够提供一套不带这些附加条件的AI基础设施方案,对很多发展中国家有吸引力。这是中国AI技术栈的潜在地缘经济价值。
DeepSeek用国产芯片训练前沿模型,是这个更大战略图景中的一个具体技术里程碑。它说明这个图景不只是愿景,而是正在被具体的工程实践一步一步地实现。
七、未解决的挑战:差距仍然存在
当然,客观呈现这个故事,需要指出中国AI技术栈仍然存在的关键差距。
芯片层的效率差距仍然显著。 昇腾910C与英伟达H100在峰值性能上有差距,更重要的是软件生态(驱动、编译器、优化工具)的成熟度差距。训练大模型时,大量的时间花在非常规的调试和适配工作上,而不是纯粹的模型训练——这降低了实际的训练效率。
先进制程芯片的制造能力受限。 华为目前的最先进芯片是在中芯国际(SMIC)的7nm制程上生产的,而台积电和三星的最先进制程已经到了2nm和3nm。制程差距意味着在相同功耗下,国产芯片的性能有天花板。台积电不被允许向华为供货(出口管制要求),而中国国内还没有成熟的先进制程芯片制造能力——这是目前芯片层最核心的瓶颈,短期内难以突破。
软件生态的开发者社区规模差距。 英伟达CUDA生态有数百万开发者积累的代码库、教程、工具链。国产框架和芯片的生态规模小得多,这意味着遇到问题时,可用的社区资源和解决方案更少,工程难度更高。
这些挑战是真实的,不应被低估。但DeepSeek用昇腾训练V4 Pro这件事说明的是:尽管挑战存在,技术可行性的边界正在持续向前推进。差距在缩小,而不是在扩大。
这就是为什么这条技术报道值得认真对待——不是因为中国AI技术栈已经完全自主,而是因为它正在走向完整,而且走向完整的速度,超出了很多人两年前的预测。
参考资料
- Technode Global: “China’s domestic AI stack gains momentum despite hardware gap” (2026-08-18): https://technode.global/2026/08/18/chinas-domestic-ai-stack-gains-momentum-despite-hardware-gap/
- Forbes: “DeepSeek Releases V4 Pro At 14x The Price Of Its Cheapest Model” (2026-08-18): https://www.forbes.com/sites/jonmarkman/2026/08/18/deepseek-releases-v4-pro-at-14x-the-price-of-its-cheapest-model/
- Xenospectrum: “DeepSeek’s Up-to-12x Price Hike: What the Numbers Reveal About China’s AI Reality” (2026-08-17): https://xenospectrum.com/en/deepseek-peak-pricing-qwen-downloads/
- 关键技术细节:DeepSeek V4 Pro在至少1000片华为昇腾910C集群上完成全参数后训练(来源:Technode Global报道)
延伸分析:对美国出口管制政策的战略评估
了解了DeepSeek的技术进展之后,一个自然而然的问题是:美国的出口管制政策是否在战略层面有效?这个问题比表面上看起来更复杂。
从直接效果看,管制确实造成了有意义的技术减速。中国AI实验室在获取最先进芯片上面临真实困难,某些规模的训练实验无法进行,这在边际上减慢了中国前沿AI能力的发展速度。
但从间接效果看,管制触发了一系列反应,其中有些反应并不符合管制设计者的初衷。
第一,管制加速了中国国产芯片生态的成熟。华为昇腾的发展节奏在2019年前是「正常商业竞争」的节奏;2019年之后,在没有替代选择的压力下,昇腾获得了更多国家资源和行业需求的支撑,发展速度明显加快。没有管制,昇腾可能今天还是「边缘选择」;有了管制,昇腾成了「必须做好」的战略资产。
第二,管制推动了中国AI研究界对「高效算法」的深度聚焦。当芯片算力相对稀缺,算法效率的价值被放大。中国研究团队在混合精度训练、稀疏模型、知识蒸馏、推理优化等「用更少算力做更多事」的方向上投入了更大资源,而这些技术能力在算力充足之后仍然有价值。
第三,管制在全球其他国家眼中,被部分解读为美国将技术领先优势用于地缘政治博弈的信号,这在一定程度上推动了一些国家加快建立自己的AI基础设施,而不是完全依赖美国技术生态。这对美国的长期技术影响力产生了复杂的副作用。
这并不意味着出口管制政策是错误的——战略决策需要在多个目标之间权衡,减缓竞争对手发展速度的目标可能仍然部分实现了。但技术决策者在评估管制效果时,需要把这些复杂的间接效果也纳入考量,而不只是看直接的「阻断效果」。
DeepSeek用国产芯片训练前沿模型,是评估这些间接效果最好的实证材料之一。它不是管制的失败,而是管制效果在复杂现实中的全貌——技术减速发生了,但独立技术路线也在加速成熟,而且这两件事同时为真。
政策制定者和市场参与者都需要用这种完整的视角,而不是单一维度的成功或失败,来理解中美AI技术竞争的当前状态和未来走向。这是一个没有简单答案、但极为重要的战略问题,DeepSeek和昇腾的故事,将是未来十年这个问题最重要的观察样本之一。
最后值得补充的是:DeepSeek用国产芯片完成训练这件事,在国内AI社区引发的反应和在国际媒体引发的反应有很大的分差。国内社区普遍将其视为技术自立的重要里程碑,充满自豪感;国际媒体的反应则更为审慎,倾向于强调「差距仍然存在」和「效率成本更高」。这两种反应都有其道理,但都有选择性地强调了故事的某一面。完整的图景是:这是一个技术可行性被证明、商业可行性仍需优化的里程碑——方向正确,但路程还长。对于任何试图理解中国AI发展真实状态的观察者,学会在这两种声音之间找到平衡点,比倾向于任何一方都更有价值。中国AI技术栈的发展,将继续是未来数年内最值得持续深度跟踪的科技战略议题之一,而每一个像DeepSeek昇腾训练这样的具体技术事件,都是这幅宏观图景中不可或缺的拼图。
中国AI技术栈的具体战略价值:对不同利益方意味着什么
理解了中国AI技术栈的完整图谱,可以从不同利益方的视角来评估它的战略意义:
对中国AI创业公司:国产技术栈的成熟意味着更高的基础设施稳定性。过去,使用英伟达GPU需要面对供货不确定性,而国产替代方案的可用性提供了「第二选择」,即便成本更高,也提供了重要的稳定保障。对于那些不依赖最新一代芯片性能的推理场景,昇腾已经基本可用。
对国际企业在华运营:中国AI技术栈的独立发展,为跨国公司带来了一个新的评估维度:在中国的AI部署,未来可能需要使用中国技术栈而非国际通用技术栈——不只是因为监管要求,也因为数据主权考量和本地优化需要。这要求跨国公司的技术团队具备同时驾驭两套技术栈的能力。
对美国出口管制政策制定者:这是最复杂的受影响方。DeepSeek用昇腾完成训练的事实,证明了出口管制的「阻断效果」有上限——被封锁方可以通过技术替代绕过部分限制。政策的制定需要在「减缓威胁」和「强化本土替代品发展」之间找到更精确的平衡,而不是简单的「更严更好」逻辑。
对全球AI治理讨论:中国AI技术栈的日益完整,意味着全球AI治理不能只有一个「英美主导的技术框架」。不同的AI技术栈背后,可能伴随着不同的算法偏好、不同的安全设计哲学、不同的数据使用规范——这些分歧,将使全球AI治理的讨论变得更加复杂,但也更加必要。
华为昇腾的技术路线图:未来三年的展望
最后值得展望的是:华为昇腾芯片的未来三年技术路线是什么?
根据公开信息,华为在2026年仍然主要依赖中芯国际的7nm工艺生产昇腾芯片,同时在国内推动7nm以下制程能力的研发(目前进展不透明)。制程工艺的提升,是昇腾性能提升的最直接路径。
软件生态方面,昇思(MindSpore)框架正在持续完善,华为在2025年大幅扩充了与PyTorch生态的兼容层(CANN编译器的改进),DeepSeek用昇腾910C成功完成训练,部分得益于这些软件层面的进步。
从市场层面,昇腾在中国AI服务器市场的份额已经有了显著提升(具体数字有不同来源引用,但趋势方向清晰)。随着更多中国AI公司开始在实际生产训练中使用昇腾,软件生态的完善速度将进一步加快——这是一个「用得越多越好用」的正反馈,而不是英伟达CUDA生态那种单方向的平台锁定。
三年后的昇腾,可能不再只是「国内可用的替代方案」,而是在某些特定场景(中文模型训练、特定推理负载优化)上具有真正竞争力的选项。这个目标是否能实现,很大程度上取决于华为能否在软件生态建设上持续投入并取得关键突破。
中国AI技术栈的故事,才刚刚开始真正精彩的章节。而DeepSeek和昇腾在2026年8月的这次技术里程碑,将是未来讲述这个故事时,不可绕过的一个重要注脚。 中国AI技术栈的建立,不只是一个科技行业的故事,而是地缘博弈、经济政策和技术发展三重力量交织产生的复杂历史进程。理解这个进程,需要同时具备技术视角、商业视角和地缘战略视角——三个视角缺一不可,任何单一维度的分析都会错过全貌。而我们今天能看到的,是这个进程正处于一个关键加速阶段。未来几年,中国AI技术栈的每一次重要进展,都值得认真对待,因为它们都是这个更大故事的具体章节。DeepSeek用昇腾910C完成全参数后训练,就是其中一个不应被低估的章节。
技术里程碑的价值,从来不只在于技术本身,而在于它所揭示的可能性。当一千片国产芯片完成了一件业界认为不可能的事,可能性的边界就发生了位移。这个位移,对于未来的技术决策者、投资者、政策制定者,将产生深远的影响——而这影响的全貌,我们今天可能才刚刚开始看清。
编者注:本文引用的Technode Global报道发布于2026年8月18日,是关于DeepSeek V4 Pro在华为昇腾910C上完成全参数后训练的首批独立核实报道之一。相关技术细节(集群规模约1000片)来自该报道,尚未经由DeepSeek或华为官方确认,读者可作为可信参考,但需注意信源说明。
在中国,有一句话叫「自力更生,艰苦奋斗」。这句话在今天的AI技术语境下,获得了一个新的具体内涵:不是意识形态的标语,而是一群工程师用一千片国产芯片,在最具挑战性的技术条件下,训练出世界级模型的实际行动。这个行动的成功,比任何政治声明都更有力地说明了中国AI技术栈的真实状态:它在前进,而且比很多外界观察者预想的更快。