英伟达独上云端,AMD折价25%:AI芯片王者地位的护城河究竟有多深?
英伟达独上云端,AMD折价25%:AI芯片王者地位的护城河究竟有多深?
2026年9月6日,如果你把所有声称「受益于AI浪潮」的芯片公司股价列成一张表,会看到一个令人不安的图案:
英伟达(NVDA)在历史高点附近徘徊。AMD折价约25%(相较历史高点)。英特尔折价约32%。Broadcom——一家在最新季报中披露AI收入同比激增221%的公司——仍然折价约18%,而且在发布财报当天股价还下跌了6%。(数据来源:Yahoo Finance 2026-09-06;Broadcom 221%数据来源:Broadcom Q3 2026财报,2026-09-03)
这是什么逻辑?
同样是「AI芯片公司」,同样在最近几个季度都报告了创纪录的AI相关收入,为什么市场给出了如此截然不同的估值?
大多数分析师的答案是:英伟达市场份额最高,大约占据AI训练芯片市场80%的份额,所以最贵是合理的。
但这只是在描述结果,不是在解释原因。真正值得回答的问题是:为什么英伟达能在过去5年里始终保持80%的市场份额,而AMD、英特尔投入了数十亿美元追赶,仍然只能在边缘市场打转?
答案不在芯片本身,在软件。更准确地说,在一个叫做CUDA的软件生态——它是英伟达历史上最成功的战略布局,也是竞争对手们迄今未能复制的壁垒。
第一章:你以为的护城河,和真正的护城河
半导体行业有一个广为人知但经常被误解的观点:「AI芯片竞争靠性能」。
这个观点有一定道理,但描述的是2020年之前的市场。在当时,英伟达凭借A100的强悍算力确立领先,AMD和英特尔在技术上落后了整整一到两代,差距来自纯粹的工程能力。
但到了2026年,技术差距已经大幅缩小。AMD的MI300X系列在某些推理和训练任务上,算力测试指标已经接近甚至超过英伟达H100。英特尔的Gaudi 3在特定工作负载下也能与英伟达产品比肩。英特尔每次财报后股价仍然低迷,不是因为产品没有进步,而是因为「产品够好」和「客户愿意采用」之间存在一个巨大的鸿沟。
这个鸿沟,就是CUDA生态。
CUDA(Compute Unified Device Architecture)是英伟达在2007年推出的软件平台,距今已经近20年。在这20年里,全球超过500万名开发者用CUDA写了数以百万计的程序、模型、优化工具,这些代码深度嵌入了PyTorch、TensorFlow、JAX等主流深度学习框架的底层调用链。
更关键的是,这些代码不是简单的API调用,而是包含了大量针对英伟达GPU特定架构的底层优化——内存访问模式、算子融合、多GPU通信协议,每一项都与英伟达硬件深度耦合。
对企业用户来说,迁移到AMD ROCm平台意味着什么?意味着你需要:
第一,评估现有所有CUDA代码的兼容性,通常需要专门的工程资源,周期以月计。
第二,重新训练工程师使用ROCm的工具链、调试器、性能分析器,每一个都与CUDA有差异。
第三,重新验证迁移后的模型性能,确保数值精度和结果没有发生变化——这在大型语言模型的训练中是极其敏感的步骤。
第四,接受在迁移窗口期内生产系统无法正常更新的代价。
以上四步的成本,经常超过切换芯片本身节省的硬件采购差价。这就是为什么,即使AMD的MI300X在某些基准测试上更优秀,企业客户在切换决策面前也往往选择观望。
英伟达建立的不是技术护城河,而是迁移成本护城河。 后者更难攻破,因为它的存在不依赖英伟达继续保持技术领先——就算英伟达停止创新一年,大多数客户也不会立刻迁走,因为迁移的痛苦依然存在。
第二章:Broadcom的221%和跌6%的课题
让我们回到那个令人困惑的数字:Broadcom AI收入同比增长221%,但发布当天股价下跌6%。
这不是市场失灵,这是市场在告诉我们一件重要的事:AI芯片市场的估值逻辑已经从「是否受益于AI」进入到「增速预期管理」的新阶段。
Broadcom的AI收入来源与英伟达根本不同。英伟达的AI收入主要来自H100/H200/B200等通用AI训练GPU,卖给全球各类AI公司和云厂商。Broadcom的AI收入主要来自两类:一是为Meta、谷歌等科技巨头提供定制AI芯片(ASIC)设计和制造服务;二是Ethernet网络基础设施,在AI数据中心的多GPU互联中发挥作用。
这两类业务都是真实的、增长的,但有一个根本差异:英伟达的客户是「需要算力就必须买英伟达」的被动需求者,Broadcom的客户是有足够规模和能力自己做定制芯片的主动设计者。
当市场预期Meta和谷歌的定制AI芯片项目下一步怎么走时,发现了一个问题:定制AI芯片的成本和周期会随时间优化,但增速不可能永远维持在221%。一旦主要客户完成了第一轮大规模定制化布局,增速必然会回落。Broadcom的股价下跌6%,是市场在对「下一个季度增速会不会降」的风险打折扣。
更直白地说:AMD、英特尔、Broadcom的折价,都包含了一个「生态贴现」——市场认为,即使这些公司的AI业务在增长,它们也不是「必选项」,而英伟达是「唯一选项」。这个从「最佳选择」到「唯一选择」的差距,值多少估值溢价?大约就是这25%到32%的折价。
第三章:护城河的两个裂缝
英伟达的护城河是真实的。但它不是没有弱点。2026年,有两把锄头正在从不同方向凿击这面墙。
第一把锄:推理专用芯片的速度颠覆
训练和推理是两种根本不同的计算需求。训练需要大规模并行浮点运算,英伟达的GPU架构是为此设计的,优势显著。但推理的核心需求是「以极低延迟快速生成每一个token」——用户输入问题后,需要在几百毫秒内看到第一个字符出现。
这里出现了英伟达无法轻松用GPU优势回答的挑战者。
英伟达在2025年12月以约200亿美元收购了Groq资产——这是英伟达历史上最大的一笔收购。Groq原本是一家推理专用芯片创业公司,其LPU(Language Processing Unit)架构在低延迟推理方面有显著优势。英伟达收购它,既是为了获取技术,也是为了把这把「锄头」控制在自己手里。
2026年,Groq 3 LPX机架进入量产:每个液冷机架封装256颗Groq芯片,在Artificial Analysis的基准测试中可以达到3400 tokens/秒,而OpenAI承诺的基于Cerebras的Ultrafast模式是750 tokens/秒。这是4.5倍的速度差,不是边际差异,是数量级的差距。
英伟达已经将Groq 3 LPX与Vera CPU、Rubin GPU一起部署到neocloud厂商Nebius。但目前Nebius是唯一一个确认部署的客户,广泛市场化仍然需要时间。这说明,推理芯片的战争还在早期,护城河还没有被凿穿,但缺口已经出现。
第二把锄:中国华为路径的「减量替代」
2026年9月7日,路透社Breakingviews发表了一篇评论:「China’s AI dragons breathe fire on Nvidia’s moat」(中国AI巨龙吐火,英伟达护城河冒烟)。
文章的核心数据来自Bloomberg 9月4日的报道:DeepSeek计划为其内蒙古1GW数据中心订购至少16万颗华为Ascend 950DT加速器。如果这个订单落实,这将是已知最大的华为AI芯片集群,规模相当于英伟达H100集群的换算算力数倍(考虑到单颗性能差距)。
华为Ascend 950DT的单颗算力,目前仍不及英伟达的上一代产品H100。但这里有一个关键的「但是」:出口管制使英伟达在中国市场基本无法销售高端AI芯片。在这个约束条件下,中国AI公司唯一的选择不是「英伟达 vs 华为」,而是「华为 vs 更差的替代品」。在这个竞争格局下,华为的技术劣势不再重要——客户没有选择。
更长远的影响是:如果中国AI基础设施完全构建于国产芯片体系之上,CUDA生态的网络效应就对这部分市场完全失效了。中国AI公司会建立自己的软件生态、自己的框架优化、自己的工具链,英伟达的软件护城河在这个市场从根本上不复存在。
这不是一个短期威胁,但它是一个长期且不可逆的结构性变化。
第四章:Intel的特殊困境与AMD的出路
从折价幅度来看,英特尔最惨:32%的折价,市场最不看好。
英特尔的困境有其独特性。它不只是一家AI芯片公司,还是一家IDM(集成设备制造商),同时负责芯片设计和芯片制造。在制造端,英特尔在4nm和3nm工艺节点上的技术追赶落后于台积电;在芯片设计端,Gaudi 3的市场接受度远低于预期。
换句话说,英特尔在AI时代面临的是「双线作战」——既要追上台积电的制造工艺,又要追上英伟达的生态优势。这两个目标都需要数十亿美元的投入和多年的执行,而市场对这种「困难模式」的耐心是有限的。
AMD的情况比英特尔好,但也有其结构性问题。AMD的AI芯片战略相对清晰:MI300X系列定位中高端AI训练和推理市场,ROCm平台专注打通与PyTorch的原生兼容性。2026年,AMD已经赢得了部分云厂商的AI工作负载测试机会,包括微软Azure和Oracle Cloud的部分推理任务。
但这里有一个「量级问题」:英伟达在AI数据中心的年营收大约是AMD的10倍。AMD要从折价25%修复到接近英伟达估值,需要的不只是「技术追平」,而是「生态追平」——这个路径可能需要更长的时间。
分析师中有一种相对乐观的看法认为,AMD的折价25%中有相当一部分是「预期折扣」,如果ROCm在未来2年内完成关键的生态突破(特别是在主流训练框架的原生支持方面),这个折价有修复可能。考虑到AMD的基本面并没有变差,这个判断并非毫无根据。
第五章:投资者视角——不同的折价,不同的故事
理解了上述背景,我们可以更清晰地描述每家公司折价的构成:
英特尔(折价32%):折价来自两个来源——AI芯片生态劣势(约10-15%)+ 制造业务追赶台积电的不确定性(约15-20%)。这是困难程度最高的折价,因为需要同时解决两个独立的、各自都很困难的问题。
AMD(折价25%):折价来源较单一——CUDA生态转换成本壁垒导致的客户选择惯性(约15-20%)+ 增速放缓预期(约5-8%)。相对而言,这是「有路径修复」的折价类型,但路径长、周期长。
Broadcom(折价18%):Broadcom的情况最微妙。221%的AI收入增长是真实的,折价18%反映的是「这个增速不可持续」的预期修正。Broadcom的核心AI业务(定制芯片设计服务)本质上是一个「高度客户集中」的B2B业务,主要依赖Meta和谷歌的定制AI芯片计划,如果这两家客户的定制化需求放缓,Broadcom的AI业务增速会迅速下降。
英伟达(接近历史高点):没有任何一种折价因素对英伟达构成近期威胁——CUDA生态在训练端坚不可摧,通用AI芯片的需求仍然旺盛,Groq收购使推理专用芯片威胁被内化。市场给的估值溢价,是对这种「接近无可替代」地位的定价。
但这里有一个值得警惕的细节:接近历史高点不等于只升不降。英伟达的估值包含了对「持续强劲增长」的预期,一旦某个季度出现增速明显放缓(无论是来自订单周期性波动还是竞争加剧),估值修正同样会来得很快。2026年底,B200/B300系列的实际部署节奏和下游采用率,将是决定英伟达股价走向的关键变量。
第六章:真正的启示——AI时代的竞争不是硬件战争
回到最初那个问题:同样是「AI芯片公司」,为什么估值分化如此剧烈?
答案可以压缩成一句话:在AI基础设施竞争中,最持久的优势不是最快的芯片,而是最难离开的生态。
这个规律并不新鲜。微软在企业软件领域统治30年,靠的不是每款产品都最好,而是Office + Azure + Active Directory织成的生态网络,每离开一步都要付出巨大代价。苹果在消费电子领域的护城河,来自App Store + iCloud + AirDrop + iMessage的多维互锁,硬件只是入口,软件黏性才是核心。
英伟达在AI算力领域重走了同样的路:硬件起步(A100),软件加固(CUDA),生态扩张(PyTorch深度整合),最终形成「每离开一步代价巨大」的格局。
AMD、英特尔、Broadcom都是真实的AI受益者,都有真实的增长,都有真实的技术进步。但它们的折价告诉我们,真实的增长和「生态不可替代性」之间,还有很长的路要走。
而那两把凿击护城河的锄头——推理速度专用化和中国市场华为替代路径——正在越来越有力。
护城河足够厚,暂时还没有穿透。
但聪明的投资者,已经开始监视墙上的裂缝了。
附录:CUDA生态护城河的历史演化
要真正理解英伟达今天的优势,需要回溯到2007年CUDA的诞生背景。
当时,英伟达面临一个战略选择:GPU要么继续专注于图形处理(消费级显卡市场),要么拓展到通用并行计算(GPGPU)。CEO黄仁勋(Jensen Huang)选择了后者,推出了CUDA,允许开发者用C语言直接编程控制GPU的并行计算能力。
这个决定在当时颇具争议。图形市场是确定的,通用计算市场的前景则完全不明朗。投资人和分析师对这条路线表示怀疑:学术界和少数科研机构可能用GPGPU,但大规模商业应用在哪里?
答案在2012年来了。那一年,Hinton实验室用AlexNet在ImageNet挑战赛上以大幅优势赢得冠军,而AlexNet正是在英伟达GPU上用CUDA训练的。这一事件引爆了深度学习革命,也直接引爆了对英伟达GPU的需求。
更关键的是,深度学习社区从一开始就建立在CUDA之上。PyTorch(2017年)和TensorFlow(2015年)的底层算子都以CUDA为默认后端开发,英伟达的GPU成了深度学习的「默认基础设施」,不是因为官方规定,而是因为所有人一开始就是这么写代码的。
此后5年的算法创新——注意力机制、Transformer架构、大语言模型预训练——每一次突破都是在CUDA环境下完成的,每一次突破都在CUDA生态中留下了新的优化代码、新的性能Benchmark、新的最佳实践。
到2026年,CUDA生态已经积累了近20年的历史债务。这里的「债务」不是贬义词,而是一种「沉淀资产」:所有写在CUDA上的代码,都是英伟达护城河的一部分,每多一行CUDA代码,这个护城河就深一分。
AMD最近5年在ROCm上的投入是真实的,进展也是真实的。但它面对的不是一个「等待被追上」的技术差距,而是一个「每天都在加深」的生态差距。英伟达的工程师每天都在优化新算法的CUDA实现,开源社区每天都在CUDA上提交新的优化PR,这个生态差距的绝对值可能每年都在增大,即使AMD的ROCm在相对成熟度上逐年提高。
这就是为什么「技术追平」不等于「市场追平」:AMD可以在性能测试上击败英伟达,但无法击败500万CUDA开发者20年来积累的代码基础。
附录二:云厂商自研芯片——护城河的「内部挑战者」
除了AMD、英特尔、Broadcom这些独立芯片公司,英伟达还面临一类特殊的竞争者:云厂商的自研AI芯片。
谷歌的TPU(Tensor Processing Unit)自2016年就在内部使用,目前已经推进到TPU v5。AWS的Trainium和Inferentia分别针对训练和推理任务,已经在AWS云内服务上规模部署。微软正在开发的Athena芯片,目标是减少对英伟达的单一供应商依赖。
这些自研芯片有一个共同特点:它们都不需要打破CUDA生态——因为它们的目标客户不是想迁移工作负载的外部企业,而是云厂商自己内部的AI训练和推理需求。换句话说,他们在绕过CUDA护城河,而不是正面攻打它。
对英伟达来说,云厂商自研芯片是一个慢刀割肉的威胁:每一块Trainium或TPU运行的工作负载,就是一块从英伟达手中流走的AI算力订单。这不会马上影响英伟达的营收,因为云厂商的自研芯片仍然只能承担其内部AI需求的一部分,但这个比例每年都在提高。
AWS在2026年上半年的财报中披露,Trainium已经承担了Amazon自身AI模型训练工作负载的约15%,预计在2027年底前提高到30%以上。如果这个趋势延续,意味着AWS购买英伟达芯片用于自身AI工作负载的比例会系统性下降。
对于英伟达的投资者来说,这是一个需要追踪的指标:云厂商自研芯片的渗透率。这个渗透率比AMD的市场份额更值得关注,因为云厂商是英伟达最大的直接客户群之一。
附录三:生态战争的历史规律——从Windows到iOS的案例参照
理解英伟达CUDA护城河的最好方式,可能是回顾科技史上其他几场「生态战争」的结局。
案例一:Windows与PC生态(1990年代)
IBM PC兼容机的Windows生态,在技术上从来都不是最优选择。Apple的Mac OS在用户体验上长期优于Windows,BeOS在多媒体处理上更先进,OS/2在稳定性上更可靠。但Windows最终占据了超过90%的PC市场份额,原因只有一个:软件生态。数以万计的PC软件是为Windows开发的,企业的IT基础设施是围绕Windows构建的,离开Windows的迁移成本远高于任何替代产品的性能优势。
这个局面持续了30年,直到移动互联网改变了「PC是主要计算设备」这个基本前提。
案例二:iOS与App Store(2008年至今)
iPhone发布时,诺基亚、RIM(BlackBerry)的技术团队做了详细的分析:iPhone的硬件性能并不突出,续航比当时的主流手机差,3G支持也更晚。但iOS最终成为了数十亿用户手机的基础设施,原因是App Store和围绕它建立的开发者生态。
当一个用户积累了足够多的iOS专属App、购买了足够多的应用内购、在iCloud存了足够多的数据,切换Android的代价就不只是手机价格,而是整个数字生活的重建。这就是「生态锁定」,它比任何单一产品的性能优势都更持久。
CUDA的对照:英伟达的CUDA在AI领域扮演了类似的角色。它建立于一个特定技术窗口(深度学习爆发前),积累了先发优势,然后用生态网络效应把这个优势固化成了「标准」。就像Windows统治PC、iOS统治移动应用,CUDA在AI训练端已经成为了事实上的标准基础设施。
关键的不同在于:Windows和iOS的护城河被移动革命(前者)和云计算(可能未来)所动摇,这两次颠覆来自「计算范式的根本转变」,不是来自更好的Windows竞争者或更好的Android。类比到英伟达,真正能颠覆其护城河的,不是AMD做出更好的ROCm,而是AI计算范式的根本转变——比如量子计算成熟、神经形态计算普及、或者AI算法从依赖大规模并行计算转向其他计算模型。
在这些转变到来之前,CUDA生态仍然是AI时代最坚固的软件护城河之一。
附录四:2026年AI算力市场格局速览
要完整理解这场竞争,需要对2026年AI算力市场的整体格局有一个清晰的认知。
训练市场:英伟达H200/B200系列仍然是绝对主流。全球主要云厂商(AWS、Azure、Google Cloud、Oracle Cloud)的AI训练集群,超过75%运行英伟达GPU。OpenAI、Meta、Anthropic、Google DeepMind的模型训练,主力仍然是英伟达算力(Google的TPU是例外,主要用于自身Gemini模型训练)。
推理市场:格局更为复杂,英伟达的份额在60-70%区间,下滑趋势明显。原因是推理对性能/价格比的敏感度更高,而英伟达的GPU在推理端并非最优。Groq(收购后归英伟达)的LPU推理速度领先,但部署规模小。Cerebras的晶圆级芯片在大模型推理上有特定优势。云厂商的Inferentia、Gaudi等正在承担越来越多的推理任务。
中国市场:出口管制使英伟达在中国高端AI芯片市场基本缺席(A800/H800早已停售,最新B系列无法出口)。华为Ascend 910C/950DT填补了部分空缺,国内初创公司(寒武纪、壁仞、天数智芯等)也在积极布局,但整体算力供给仍然落后于美国约2-3年。
边缘推理市场:英伟达的Jetson系列和Qualcomm的AI芯片在这个市场各自占据重要地位,这是一个英伟达优势相对较弱、竞争更为激烈的市场。
从这个全景来看,英伟达在训练端的护城河最为坚固,在推理端的压力已经可见,在中国市场正在被替代,在边缘市场面临真实竞争。这种「分市场」的格局,解释了为什么英伟达的整体估值仍然极高,但竞争格局的细化分析是必要的。
最终,AI芯片市场的竞争不会以「英伟达输了」或「英伟达赢了」的简单结局收场,而更可能是:英伟达保持训练端主导地位,同时在推理端、特定垂直场景、地区市场接受越来越多的「有限替代」。这种格局下,英伟达的护城河会持续存在,但不再是无边界的——折价的竞争对手们,在各自的细分市场,已经开始建立自己的位置。
结语的补充:当所有人都在谈「AI芯片」,真正的赌注在哪里
2026年秋天,半导体市场给了我们一个教科书级别的案例:相同的「AI受益」标签,可以产生完全不同的市场表现。
英伟达接近历史高点、Broadcom跌6%、AMD折价25%、英特尔折价32%——这不是市场错误,这是市场在精确定价「生态不可替代性」和「增速可持续性」两个维度的差异。
对想理解这个市场的人,有一个简单的思维框架:
问题1:这家公司的AI收入来源,是客户「无处可逃」的锁定需求,还是客户「自愿选择」的最优方案?
英伟达的训练芯片需求,很大程度上是「无处可逃」的锁定需求。Broadcom的定制芯片需求,是科技巨头「自愿选择」的定制化方案——如果经济账算不过来,他们可以不定制。AMD的GPU,是「希望逃离英伟达」的客户的次优选项——这是增量机会,不是保底基础。
问题2:这家公司的护城河,是随着AI市场扩大而加深,还是随着技术进步而变浅?
英伟达的CUDA生态随AI市场扩大而加深——每一个新的AI应用、新的AI框架、新的AI开发者,大概率都在加固CUDA的护城河。AMD的ROCm如果能做到与CUDA同等的原生支持,则这条护城河会开始变浅,但这个「如果」还没有发生。
当你用这两个问题评估一家AI芯片公司,估值的差异就不再令人困惑了。
它们的折价,是市场对这两个问题最诚实的回答。
参考资料
- Nvidia Is Near Its High While Biggest Chip Peers Sit 18-32% Below - Yahoo Finance,2026-09-06(Nvidia及同行股价数据)
- Broadcom Falls 6% as Soft Guidance Overshadows 221% AI Revenue Surge; NVIDIA Inches Higher, AMD Slips - 247wallst,2026-09-03(Broadcom Q3财报数据)
- NVIDIA (NVDA)’s $20 Billion Groq Bet Goes Live This Year With New AI Racks - Yahoo Finance,2026-09-06(Nvidia Groq 3 LPX量产部署)
- China’s AI dragons breathe fire on Nvidia’s moat - Reuters Breakingviews,2026-09-07(中国AI对英伟达护城河的系统性分析)
- DeepSeek said to order at least 160K Huawei AI accelerators for new data center: report - MSN/Bloomberg,2026-09-04(DeepSeek华为芯片订单来源数据)
- Nvidia is bolstering support for Chinese open AI models as it warns of White House crackdown - CNBC,2026-08-27(Nvidia中国市场策略及出口管制背景)