训练时代已过,推理时代来临:Broadcom 36%涨幅背后,NVIDIA的AI芯片垄断正在被系统性挑战
在人工智能热潮最盛的这几年,”买NVIDIA”几乎是科技股投资中最简单、最有效的策略之一。H100、B200、Vera Rubin,每一代芯片都成为稀缺资源,NVIDIA市值在两年内从不足5000亿美元攀升至全球第一。这个故事已经被讲述了太多次。
但2026年上半年,一个更微妙的信号出现了:Broadcom的股价在6个月内上涨了36%(据2026-08-07金融媒体报道,Synergy Research数据),超过了同期NVIDIA的涨幅。
Broadcom是谁?如果你不是芯片行业的从业者,你可能对这家公司并不熟悉。但它是全球最重要的半导体公司之一,年收入超过600亿美元,其网络芯片和定制AI加速器广泛用于云服务商的数据中心。
Broadcom跑赢NVIDIA,不是一个随机的市场波动。它指向了AI芯片竞争格局正在发生的一个结构性转变:从训练主导的GPU时代,向推理多元化的新时代过渡。
理解AI芯片的两个时代
要理解这个转变,需要先理解AI计算的两个基本阶段。
训练阶段(Training)
训练是从零开始构建AI模型的过程。这个过程需要消耗巨量的计算资源,对GPU的需求是”越多越好”——一个大型语言模型的训练可能需要数千张H100持续运行数周乃至数月。
训练阶段的特点是:计算需求密集、时间集中(训练完就可以停下来)、对芯片类型的要求相对统一。NVIDIA的H100/B200在这个场景中建立了近乎垄断的地位——强大的CUDA生态、成熟的软件支持、最高的每瓦算力,让其他芯片很难竞争。
从2022年ChatGPT发布到2025年,训练阶段是AI芯片市场的主旋律。OpenAI、Anthropic、Google等顶级实验室都在疯狂采购NVIDIA的GPU用于训练。这解释了NVIDIA的爆炸式增长。
推理阶段(Inference)
推理是将已训练好的模型部署运行的过程。每次你向ChatGPT提问,Claude给你回答,Gemini帮你生成图片,背后都是推理计算。
推理阶段的特点完全不同:计算需求持续(用户每天都在使用)、对延迟(响应速度)极为敏感、工作负载相对固定(给定模型的推理计算量基本稳定)。
这些特点让推理场景对芯片的要求发生了根本性变化:不再是”越大越好”的通用GPU,而是特定场景下效率最优的专用加速器。这恰恰是ASIC(应用专用集成电路)和定制芯片的强项领域,而Broadcom正是这类定制芯片的最重要提供商之一。
Broadcom在AI推理市场的核心优势
Broadcom的业务在AI时代经历了深度转型。除了传统的网络芯片和数据中心互联业务,Broadcom已经成为Google、Meta等超大规模云服务商开发专用AI加速器(TPU/内部芯片)的最重要合作伙伴。
定制化的竞争壁垒
Google的TPU(张量处理单元)系列,是专门为TensorFlow和JAX框架优化的自研芯片,在Google内部深度学习推理场景下,每瓦算力和延迟表现都优于通用GPU。这些TPU的封装和互联层,相当程度上依赖Broadcom的核心技术。
Meta的定制AI芯片(MTIA系列)同样如此。这类定制芯片在固定的推理工作负载下,可以比通用NVIDIA GPU节省30-50%的运营成本,同时降低延迟。对于Meta这种每天需要处理数十亿次推荐计算的平台,这个成本节省直接转化为数十亿美元的运营效率。
网络芯片的战略地位
AI数据中心的另一个核心需求是高带宽低延迟的芯片互联网络。当数千张GPU需要协同工作时,它们之间的通信带宽和效率决定了整个训练和推理系统的性能上限。
Broadcom的网络芯片(尤其是Tomahawk和Trident系列)在这个领域占据领导地位。AI数据中心的规模越大,对高性能网络芯片的需求就越强,Broadcom的营收受益就越明显。
随着AI从训练为主转向推理为主,数据中心的常规运营负载(而非集中训练的脉冲式需求)在持续增长,Broadcom的网络芯片业务随之进入了一个更稳定的增长曲线。
NVIDIA垄断的裂缝:训练护城河在推理时代是否依然有效
NVIDIA的CUDA生态是其最深的护城河。20年来,NVIDIA将CUDA从一个简单的GPU编程接口打造成了整个AI开发的事实标准——无数AI研究库、框架、工具都基于CUDA构建。这种软件生态的锁定效应,让竞争对手即使在芯片算力上接近NVIDIA,也很难在实际应用中取代它。
但CUDA护城河在推理场景中的有效性正在被质疑。
推理需求的标准化
在训练场景中,研究人员需要灵活地修改模型架构、调试梯度计算、尝试新的训练技术,CUDA的通用性和灵活性是不可替代的。
但在推理场景中,一旦模型训练完成并部署,计算图(computation graph)是固定的,需要的是将这个固定图高效执行的硬件,而不是通用灵活的编程接口。这让专用推理芯片(包括Broadcom的定制解决方案)有了真正的用武之地。
云服务商的自研趋势
AWS的Graviton(CPU)和Inferentia(推理芯片)、Google的TPU、Microsoft的Maia,以及Anthropic宣布招募自研芯片团队——主要云服务商都在投资自研芯片,目标就是降低对NVIDIA的依赖,在推理场景获得更好的性价比。
这个趋势有其结构性逻辑:NVIDIA的GPU利润率极高(毛利率超过75%),云服务商每年向NVIDIA支付数百亿美元的采购费用。如果能用自研芯片替代15-20%的推理工作负载,就意味着数十亿美元的成本节省,这远超自研芯片的开发成本。
Broadcom作为这些云服务商自研芯片的核心合作伙伴,恰好站在了这个趋势的中间位置。
软件生态的碎片化
另一个削弱CUDA护城河的因素是推理部署框架的多样化。vLLM、TensorRT-LLM、ONNX Runtime等推理优化框架的出现,让AI模型在多种硬件上部署变得更容易。这些框架提供了硬件抽象层,让开发者不需要直接面对底层芯片差异。
这不意味着CUDA的护城河已经消失,但它意味着:在推理场景中,改用非NVIDIA芯片的迁移成本正在逐渐降低。
芯片竞争格局的新地图
2026年上半年,半导体市场呈现出一幅比2024年更复杂的竞争图景。
台积电股价因Q2业绩超预期而大涨7%,半导体行业整体保持强势。但在这个整体向好的背景下,内部分化正在加剧:
NVIDIA仍然领先,但垄断性在削弱
Vera Rubin系列已经开始向各大云服务商发货,训练市场的领导地位短期无可撼动。但NVIDIA的估值已经price in了相当程度的长期预期,任何关于市场份额下降的信号都会引发投资者的担忧。
Broadcom:推理时代的最大受益者之一
Broadcom的36%涨幅反映了市场对”推理时代定制芯片受益者”的提前定价。随着云服务商持续扩大自研芯片的使用规模,Broadcom作为核心供应链伙伴,将获得更稳定、更可预期的收入增长。
AMD:机会与挑战并存
AMD收购Taalas(一家AI推理专用ASIC初创公司)的决定,是其在推理市场发力的明确信号。但AMD在软件生态建设上仍然落后于NVIDIA,短期内很难在训练市场取得突破,推理市场的机会需要时间兑现。
Anthropic和其他AI公司的自研芯片计划
Anthropic宣布招募芯片设计团队,意在开发专门针对Claude模型优化的推理芯片。这与Meta、Google的路径类似:利用自己对特定模型架构的深度了解,设计”量体裁衣”的推理加速器。
这类自研项目需要2-3年才能出成果,但一旦成功,将直接减少对NVIDIA GPU的推理依赖。
对投资者和企业决策者的实际影响
Broadcom跑赢NVIDIA的信号,对不同角色的决策者有不同的含义。
对科技股投资者
AI芯片不是一个单一赛道,而是由训练、推理、互联等多个分市场构成的生态系统。2024年的市场只定价了NVIDIA在训练市场的领导地位,却低估了推理市场成熟后整个生态系统的分化。
投资AI基础设施,需要开始区分”训练受益者”和”推理受益者”——这两个赛道的增长节奏和竞争格局有结构性差异。NVIDIA不会消失,但AI芯片红利的分配逻辑正在变得更加多元。
对企业IT决策者
如果你正在为企业的AI推理基础设施做采购决策,2026年是一个关键窗口期:
第一,NVIDIA GPU在需要灵活性的场景(快速迭代的模型开发、研发环境)中仍然是最佳选择。
第二,对于大规模、固定工作负载的推理场景(比如统一部署的对话机器人、标准化的文本分类任务),开始评估定制AI加速器的总拥有成本(TCO)是值得的。定制芯片的前期集成成本更高,但在大规模部署下每次推理的边际成本更低。
第三,关注云服务商提供的新推理选项。AWS Inferentia 3、Google TPU v5,这些定制推理芯片的单位推理成本正在快速接近甚至低于等量NVIDIA GPU的水平。
对AI创业者
计算成本是AI产品的核心运营成本之一。随着推理芯片竞争加剧,推理单价将进入长期下行通道——这对所有依赖API调用运营的AI应用公司是显著的正面信号。
计算成本降低10倍,可能让一批目前商业模式存疑的AI应用公司突然变得可行。反之,对于那些只能在计算极其昂贵时才有护城河(因为竞争者负担不起)的AI公司,推理成本的下降会加速竞争。
不可忽视的反驳论点
在讨论NVIDIA垄断被挑战的叙事时,必须承认它的反驳论点,避免过度乐观。
CUDA生态的黏性比想象中更强
尽管推理场景的硬件要求不同于训练,但实际情况是:大多数企业的AI工程师都是在CUDA生态中成长的,他们对PyTorch、TensorFlow的熟悉度远超其他框架。迁移到定制芯片需要软件重写、测试、优化,这些迁移成本在很多企业的实际决策中占有相当大的权重。
规模经济的持续作用
NVIDIA每年在GPU研发上投入超过100亿美元。这种规模的研发投入让它能够在芯片性能上保持领先——即使竞争对手的定制芯片在特定场景下有优势,NVIDIA下一代GPU的发布往往又会改变对比结果。
定制芯片的高门槛
Broadcom和Google、Meta合作开发的定制芯片,能力门槛非常高:需要超大规模的部署量才能摊平开发成本,需要专门的软件团队维护,需要与模型架构深度绑定。绝大多数企业没有Google或Meta的规模,无法走这条路。
对于90%的企业,NVIDIA GPU加上成熟的云服务仍然是最合理的推理方案。Broadcom的机会主要在超大规模云服务商这个市场,而不是大众企业市场。
结语:一个时代的过渡信号
Broadcom在6个月内涨幅36%超越NVIDIA,不是终点,而是一个过渡信号。
它告诉我们:AI芯片市场正在从训练驱动的爆发期,进入推理主导的成熟期。这个成熟期的特点是:竞争格局更多元,用户场景更细分,性价比成为核心决策维度,”最好的芯片”不再是唯一答案,”最适合的芯片”才是新的竞争焦点。
在这个过渡中,NVIDIA不会消失,但它的垄断地位将因场景分化而逐渐稀释。而Broadcom、AMD、各家云服务商的自研芯片,将在各自擅长的推理场景中收复市场。
这对整个AI产业是好消息:更激烈的竞争将持续推动推理成本下降,让AI应用的经济性不断改善,让更多应用场景变得商业可行。
对NVIDIA的投资者而言,这是一个需要重新评估长期逻辑的时刻:不是”NVIDIA要完了”,而是”NVIDIA在哪些场景中仍然不可替代,在哪些场景中开始面临真实竞争”——把这个问题想清楚了,才能做出正确的仓位判断。
AI芯片的权力地图,正在被悄悄重绘。
从投资者视角看这场芯片格局变化:风险与机遇并存
在理解Broadcom跑赢NVIDIA的市场信号时,还有一个维度值得单独讨论:这对不同类型的科技股投资者意味着什么。
2024年,AI芯片投资的逻辑极为简单:买NVIDIA就对了。这个逻辑有效是因为当时训练需求爆炸式增长,NVIDIA的GPU是无可替代的稀缺资源。”AI就是NVIDIA”这个等式,在两年内让NVIDIA市值增长了超过3倍。
但市场的共识一旦形成,超额收益就开始消失。到2026年,所有人都知道NVIDIA是AI芯片领导者,这个事实已经被充分定价。真正的投资超额收益,往往来自于”大多数人还没看到的趋势”。
Broadcom的36%涨幅之所以值得关注,正是因为它代表了一个市场正在开始定价但还没有充分定价的趋势:推理时代的专用芯片价值。
评估芯片股的新框架:训练受益者 vs 推理受益者
传统的AI芯片评估框架是线性的:谁的算力最强,谁就赢。H100>A100>H200>B200,NVIDIA的代际领先决定了市场地位。
但随着AI应用从实验室走向大规模商业部署,需要新的评估框架:
训练受益者:主要从模型训练的算力需求中获益。代表企业:NVIDIA。这类公司随AI研究投入的脉冲式增长而增长,有明显的周期性(训练密集期→布局期的轮动)。
推理受益者:主要从AI模型的常规运营中获益。代表企业:Broadcom(定制芯片)、各云服务商(推理服务)。这类公司的增长更平稳,与AI应用的日活跃用户增长正相关,更接近”基础设施稳定收入”的逻辑。
双重受益者:台积电是最典型的例子——无论训练还是推理,都需要先进制程芯片,台积电的晶圆代工服务都是必须经过的环节。这解释了台积电在Q2业绩超预期后的大涨。
从2026年的市场情况看,推理受益者的确定性增长逻辑正在被越来越多的机构投资者认可。这是Broadcom股价走强的深层原因。
关于NVIDIA的长期逻辑再评估
NVIDIA的Blackwell(B200)系列在2025年创造了半导体史上最快的产品爬坡,Vera Rubin在2026年上半年开始发货,短期内的训练芯片市场领导地位无可置疑。
但有几个长期风险值得关注:
第一,自研芯片趋势的加速。Google TPU每一代都在缩小与NVIDIA GPU的差距,Meta的MTIA系列已经在Meta内部推理场景中部分替代了NVIDIA。这些自研芯片的规模持续扩大,意味着超大云服务商对NVIDIA的边际需求增速可能放缓。
第二,开源模型的崛起对训练需求的影响。如果越来越多的企业选择部署开源模型(DeepSeek V4、Llama系列等),而不是训练自有模型,整个训练市场的规模就会收缩。这直接冲击NVIDIA的核心市场。
第三,推理效率的持续提升削减需求量。模型量化、蒸馏、批处理优化等技术让单位推理成本持续下降,在用户量增长的同时,所需的芯片数量增速可能低于用户量增速。
这些不是NVIDIA崩塌的论据,而是”NVIDIA的增长天花板可能比市场当前预期更快到来”的信号。
台积电的独特地位:竞争的最大受益者
在训练 vs 推理的竞争格局中,有一个独特的赢家:台积电。
无论是NVIDIA的H100、Broadcom的定制芯片、Google的TPU,还是Anthropic的自研芯片,最终都需要台积电的先进制程(3nm、2nm)来生产。AI芯片竞争越激烈,先进制程的需求就越大,台积电的定价权和产能利用率就越高。
斯坦利·德鲁肯米勒在台积电Q2业绩超预期后选择持仓而非减仓,正是基于这个逻辑:台积电是AI芯片竞争的基础设施层,它的收益不依赖某一家芯片公司的胜出,而是依赖AI芯片整体需求的增长。
这是一个”受益于竞争,不受困于竞争”的独特商业位置。
结语:推理时代才是AI的真正商业化阶段
模型训练是AI的研发投入阶段——每次训练代表着一次大规模的算力消耗,产出是一个可以被多次使用的模型。
而推理是AI的商业化阶段——每一次用户与AI对话,每一次企业AI应用被调用,都是一次推理计算,产生实际的商业价值。
全球AI应用的用户量正在从数亿向数十亿迈进,这意味着每天发生的推理次数将以指数级增长。推理基础设施的规模,将最终远超训练基础设施的规模。
在这个背景下,Broadcom的36%涨幅不只是一个股价数据,它是AI产业进入大规模商业化阶段的一个信号灯。在训练时代建立垄断的NVIDIA,将在推理时代面临来自定制芯片、云服务商自研方案的系统性竞争。
这个过渡需要多少年才能完成?没有人知道。但Broadcom跑赢NVIDIA的这一刻,可能正是这个历史转折点的开端。
参考资料
- “Top Semiconductor Stock Outpacing Nvidia With a 36% Gain Over 6 Months”, 2026-08-07
- NVIDIA Vera Rubin chips begin shipping to cloud providers (AI基础设施, 2026-08-04)
- “Intel and AMD Soar 13%, Taiwan Semiconductor Rallies 7% as AI-Chip Stocks Surge”, 2026-07-30
- “AMD to Acquire AI Chip Start-up Taalas in Bid to Challenge NVIDIA”, 2026-08-07: (Financial Times, 2026-08-07)
- “Anthropic is hiring an AI chip design team”, TechCrunch, 2026-08-05: https://techcrunch.com/2026/08/05/anthropic-is-hiring-an-ai-chip-design-team/
- Google Cloud Q2 2026 market share data (Synergy Research Group, 2026-08-06)
- “AWS Vs. Microsoft Vs. Google Cloud Earnings Q2 2026 Face-Off”, 2026-08-03
- Stanley Druckenmiller Taiwan Semiconductor position (13F filing, 2026-Q2)