在人工智能热潮最盛的这几年,”买NVIDIA”几乎是科技股投资中最简单、最有效的策略之一。H100、B200、Vera Rubin,每一代芯片都成为稀缺资源,NVIDIA市值在两年内从不足5000亿美元攀升至全球第一。这个故事已经被讲述了太多次。

但2026年上半年,一个更微妙的信号出现了:Broadcom的股价在6个月内上涨了36%(据2026-08-07金融媒体报道,Synergy Research数据),超过了同期NVIDIA的涨幅。

Broadcom是谁?如果你不是芯片行业的从业者,你可能对这家公司并不熟悉。但它是全球最重要的半导体公司之一,年收入超过600亿美元,其网络芯片和定制AI加速器广泛用于云服务商的数据中心。

Broadcom跑赢NVIDIA,不是一个随机的市场波动。它指向了AI芯片竞争格局正在发生的一个结构性转变:从训练主导的GPU时代,向推理多元化的新时代过渡。

理解AI芯片的两个时代

要理解这个转变,需要先理解AI计算的两个基本阶段。

训练阶段(Training)

训练是从零开始构建AI模型的过程。这个过程需要消耗巨量的计算资源,对GPU的需求是”越多越好”——一个大型语言模型的训练可能需要数千张H100持续运行数周乃至数月。

训练阶段的特点是:计算需求密集、时间集中(训练完就可以停下来)、对芯片类型的要求相对统一。NVIDIA的H100/B200在这个场景中建立了近乎垄断的地位——强大的CUDA生态、成熟的软件支持、最高的每瓦算力,让其他芯片很难竞争。

从2022年ChatGPT发布到2025年,训练阶段是AI芯片市场的主旋律。OpenAI、Anthropic、Google等顶级实验室都在疯狂采购NVIDIA的GPU用于训练。这解释了NVIDIA的爆炸式增长。

推理阶段(Inference)

推理是将已训练好的模型部署运行的过程。每次你向ChatGPT提问,Claude给你回答,Gemini帮你生成图片,背后都是推理计算。

推理阶段的特点完全不同:计算需求持续(用户每天都在使用)、对延迟(响应速度)极为敏感、工作负载相对固定(给定模型的推理计算量基本稳定)。

这些特点让推理场景对芯片的要求发生了根本性变化:不再是”越大越好”的通用GPU,而是特定场景下效率最优的专用加速器。这恰恰是ASIC(应用专用集成电路)和定制芯片的强项领域,而Broadcom正是这类定制芯片的最重要提供商之一。

Broadcom在AI推理市场的核心优势

Broadcom的业务在AI时代经历了深度转型。除了传统的网络芯片和数据中心互联业务,Broadcom已经成为Google、Meta等超大规模云服务商开发专用AI加速器(TPU/内部芯片)的最重要合作伙伴。

定制化的竞争壁垒

Google的TPU(张量处理单元)系列,是专门为TensorFlow和JAX框架优化的自研芯片,在Google内部深度学习推理场景下,每瓦算力和延迟表现都优于通用GPU。这些TPU的封装和互联层,相当程度上依赖Broadcom的核心技术。

Meta的定制AI芯片(MTIA系列)同样如此。这类定制芯片在固定的推理工作负载下,可以比通用NVIDIA GPU节省30-50%的运营成本,同时降低延迟。对于Meta这种每天需要处理数十亿次推荐计算的平台,这个成本节省直接转化为数十亿美元的运营效率。

网络芯片的战略地位

AI数据中心的另一个核心需求是高带宽低延迟的芯片互联网络。当数千张GPU需要协同工作时,它们之间的通信带宽和效率决定了整个训练和推理系统的性能上限。

Broadcom的网络芯片(尤其是Tomahawk和Trident系列)在这个领域占据领导地位。AI数据中心的规模越大,对高性能网络芯片的需求就越强,Broadcom的营收受益就越明显。

随着AI从训练为主转向推理为主,数据中心的常规运营负载(而非集中训练的脉冲式需求)在持续增长,Broadcom的网络芯片业务随之进入了一个更稳定的增长曲线。

NVIDIA垄断的裂缝:训练护城河在推理时代是否依然有效

NVIDIA的CUDA生态是其最深的护城河。20年来,NVIDIA将CUDA从一个简单的GPU编程接口打造成了整个AI开发的事实标准——无数AI研究库、框架、工具都基于CUDA构建。这种软件生态的锁定效应,让竞争对手即使在芯片算力上接近NVIDIA,也很难在实际应用中取代它。

但CUDA护城河在推理场景中的有效性正在被质疑。

推理需求的标准化

在训练场景中,研究人员需要灵活地修改模型架构、调试梯度计算、尝试新的训练技术,CUDA的通用性和灵活性是不可替代的。

但在推理场景中,一旦模型训练完成并部署,计算图(computation graph)是固定的,需要的是将这个固定图高效执行的硬件,而不是通用灵活的编程接口。这让专用推理芯片(包括Broadcom的定制解决方案)有了真正的用武之地。

云服务商的自研趋势

AWS的Graviton(CPU)和Inferentia(推理芯片)、Google的TPU、Microsoft的Maia,以及Anthropic宣布招募自研芯片团队——主要云服务商都在投资自研芯片,目标就是降低对NVIDIA的依赖,在推理场景获得更好的性价比。

这个趋势有其结构性逻辑:NVIDIA的GPU利润率极高(毛利率超过75%),云服务商每年向NVIDIA支付数百亿美元的采购费用。如果能用自研芯片替代15-20%的推理工作负载,就意味着数十亿美元的成本节省,这远超自研芯片的开发成本。

Broadcom作为这些云服务商自研芯片的核心合作伙伴,恰好站在了这个趋势的中间位置。

软件生态的碎片化

另一个削弱CUDA护城河的因素是推理部署框架的多样化。vLLM、TensorRT-LLM、ONNX Runtime等推理优化框架的出现,让AI模型在多种硬件上部署变得更容易。这些框架提供了硬件抽象层,让开发者不需要直接面对底层芯片差异。

这不意味着CUDA的护城河已经消失,但它意味着:在推理场景中,改用非NVIDIA芯片的迁移成本正在逐渐降低。

芯片竞争格局的新地图

2026年上半年,半导体市场呈现出一幅比2024年更复杂的竞争图景。

台积电股价因Q2业绩超预期而大涨7%,半导体行业整体保持强势。但在这个整体向好的背景下,内部分化正在加剧:

NVIDIA仍然领先,但垄断性在削弱

Vera Rubin系列已经开始向各大云服务商发货,训练市场的领导地位短期无可撼动。但NVIDIA的估值已经price in了相当程度的长期预期,任何关于市场份额下降的信号都会引发投资者的担忧。

Broadcom:推理时代的最大受益者之一

Broadcom的36%涨幅反映了市场对”推理时代定制芯片受益者”的提前定价。随着云服务商持续扩大自研芯片的使用规模,Broadcom作为核心供应链伙伴,将获得更稳定、更可预期的收入增长。

AMD:机会与挑战并存

AMD收购Taalas(一家AI推理专用ASIC初创公司)的决定,是其在推理市场发力的明确信号。但AMD在软件生态建设上仍然落后于NVIDIA,短期内很难在训练市场取得突破,推理市场的机会需要时间兑现。

Anthropic和其他AI公司的自研芯片计划

Anthropic宣布招募芯片设计团队,意在开发专门针对Claude模型优化的推理芯片。这与Meta、Google的路径类似:利用自己对特定模型架构的深度了解,设计”量体裁衣”的推理加速器。

这类自研项目需要2-3年才能出成果,但一旦成功,将直接减少对NVIDIA GPU的推理依赖。

对投资者和企业决策者的实际影响

Broadcom跑赢NVIDIA的信号,对不同角色的决策者有不同的含义。

对科技股投资者

AI芯片不是一个单一赛道,而是由训练、推理、互联等多个分市场构成的生态系统。2024年的市场只定价了NVIDIA在训练市场的领导地位,却低估了推理市场成熟后整个生态系统的分化。

投资AI基础设施,需要开始区分”训练受益者”和”推理受益者”——这两个赛道的增长节奏和竞争格局有结构性差异。NVIDIA不会消失,但AI芯片红利的分配逻辑正在变得更加多元。

对企业IT决策者

如果你正在为企业的AI推理基础设施做采购决策,2026年是一个关键窗口期:

第一,NVIDIA GPU在需要灵活性的场景(快速迭代的模型开发、研发环境)中仍然是最佳选择。

第二,对于大规模、固定工作负载的推理场景(比如统一部署的对话机器人、标准化的文本分类任务),开始评估定制AI加速器的总拥有成本(TCO)是值得的。定制芯片的前期集成成本更高,但在大规模部署下每次推理的边际成本更低。

第三,关注云服务商提供的新推理选项。AWS Inferentia 3、Google TPU v5,这些定制推理芯片的单位推理成本正在快速接近甚至低于等量NVIDIA GPU的水平。

对AI创业者

计算成本是AI产品的核心运营成本之一。随着推理芯片竞争加剧,推理单价将进入长期下行通道——这对所有依赖API调用运营的AI应用公司是显著的正面信号。

计算成本降低10倍,可能让一批目前商业模式存疑的AI应用公司突然变得可行。反之,对于那些只能在计算极其昂贵时才有护城河(因为竞争者负担不起)的AI公司,推理成本的下降会加速竞争。

不可忽视的反驳论点

在讨论NVIDIA垄断被挑战的叙事时,必须承认它的反驳论点,避免过度乐观。

CUDA生态的黏性比想象中更强

尽管推理场景的硬件要求不同于训练,但实际情况是:大多数企业的AI工程师都是在CUDA生态中成长的,他们对PyTorch、TensorFlow的熟悉度远超其他框架。迁移到定制芯片需要软件重写、测试、优化,这些迁移成本在很多企业的实际决策中占有相当大的权重。

规模经济的持续作用

NVIDIA每年在GPU研发上投入超过100亿美元。这种规模的研发投入让它能够在芯片性能上保持领先——即使竞争对手的定制芯片在特定场景下有优势,NVIDIA下一代GPU的发布往往又会改变对比结果。

定制芯片的高门槛

Broadcom和Google、Meta合作开发的定制芯片,能力门槛非常高:需要超大规模的部署量才能摊平开发成本,需要专门的软件团队维护,需要与模型架构深度绑定。绝大多数企业没有Google或Meta的规模,无法走这条路。

对于90%的企业,NVIDIA GPU加上成熟的云服务仍然是最合理的推理方案。Broadcom的机会主要在超大规模云服务商这个市场,而不是大众企业市场。

结语:一个时代的过渡信号

Broadcom在6个月内涨幅36%超越NVIDIA,不是终点,而是一个过渡信号。

它告诉我们:AI芯片市场正在从训练驱动的爆发期,进入推理主导的成熟期。这个成熟期的特点是:竞争格局更多元,用户场景更细分,性价比成为核心决策维度,”最好的芯片”不再是唯一答案,”最适合的芯片”才是新的竞争焦点。

在这个过渡中,NVIDIA不会消失,但它的垄断地位将因场景分化而逐渐稀释。而Broadcom、AMD、各家云服务商的自研芯片,将在各自擅长的推理场景中收复市场。

这对整个AI产业是好消息:更激烈的竞争将持续推动推理成本下降,让AI应用的经济性不断改善,让更多应用场景变得商业可行。

对NVIDIA的投资者而言,这是一个需要重新评估长期逻辑的时刻:不是”NVIDIA要完了”,而是”NVIDIA在哪些场景中仍然不可替代,在哪些场景中开始面临真实竞争”——把这个问题想清楚了,才能做出正确的仓位判断。

AI芯片的权力地图,正在被悄悄重绘。

从投资者视角看这场芯片格局变化:风险与机遇并存

在理解Broadcom跑赢NVIDIA的市场信号时,还有一个维度值得单独讨论:这对不同类型的科技股投资者意味着什么。

2024年,AI芯片投资的逻辑极为简单:买NVIDIA就对了。这个逻辑有效是因为当时训练需求爆炸式增长,NVIDIA的GPU是无可替代的稀缺资源。”AI就是NVIDIA”这个等式,在两年内让NVIDIA市值增长了超过3倍。

但市场的共识一旦形成,超额收益就开始消失。到2026年,所有人都知道NVIDIA是AI芯片领导者,这个事实已经被充分定价。真正的投资超额收益,往往来自于”大多数人还没看到的趋势”。

Broadcom的36%涨幅之所以值得关注,正是因为它代表了一个市场正在开始定价但还没有充分定价的趋势:推理时代的专用芯片价值。

评估芯片股的新框架:训练受益者 vs 推理受益者

传统的AI芯片评估框架是线性的:谁的算力最强,谁就赢。H100>A100>H200>B200,NVIDIA的代际领先决定了市场地位。

但随着AI应用从实验室走向大规模商业部署,需要新的评估框架:

训练受益者:主要从模型训练的算力需求中获益。代表企业:NVIDIA。这类公司随AI研究投入的脉冲式增长而增长,有明显的周期性(训练密集期→布局期的轮动)。

推理受益者:主要从AI模型的常规运营中获益。代表企业:Broadcom(定制芯片)、各云服务商(推理服务)。这类公司的增长更平稳,与AI应用的日活跃用户增长正相关,更接近”基础设施稳定收入”的逻辑。

双重受益者:台积电是最典型的例子——无论训练还是推理,都需要先进制程芯片,台积电的晶圆代工服务都是必须经过的环节。这解释了台积电在Q2业绩超预期后的大涨。

从2026年的市场情况看,推理受益者的确定性增长逻辑正在被越来越多的机构投资者认可。这是Broadcom股价走强的深层原因。

关于NVIDIA的长期逻辑再评估

NVIDIA的Blackwell(B200)系列在2025年创造了半导体史上最快的产品爬坡,Vera Rubin在2026年上半年开始发货,短期内的训练芯片市场领导地位无可置疑。

但有几个长期风险值得关注:

第一,自研芯片趋势的加速。Google TPU每一代都在缩小与NVIDIA GPU的差距,Meta的MTIA系列已经在Meta内部推理场景中部分替代了NVIDIA。这些自研芯片的规模持续扩大,意味着超大云服务商对NVIDIA的边际需求增速可能放缓。

第二,开源模型的崛起对训练需求的影响。如果越来越多的企业选择部署开源模型(DeepSeek V4、Llama系列等),而不是训练自有模型,整个训练市场的规模就会收缩。这直接冲击NVIDIA的核心市场。

第三,推理效率的持续提升削减需求量。模型量化、蒸馏、批处理优化等技术让单位推理成本持续下降,在用户量增长的同时,所需的芯片数量增速可能低于用户量增速。

这些不是NVIDIA崩塌的论据,而是”NVIDIA的增长天花板可能比市场当前预期更快到来”的信号。

台积电的独特地位:竞争的最大受益者

在训练 vs 推理的竞争格局中,有一个独特的赢家:台积电。

无论是NVIDIA的H100、Broadcom的定制芯片、Google的TPU,还是Anthropic的自研芯片,最终都需要台积电的先进制程(3nm、2nm)来生产。AI芯片竞争越激烈,先进制程的需求就越大,台积电的定价权和产能利用率就越高。

斯坦利·德鲁肯米勒在台积电Q2业绩超预期后选择持仓而非减仓,正是基于这个逻辑:台积电是AI芯片竞争的基础设施层,它的收益不依赖某一家芯片公司的胜出,而是依赖AI芯片整体需求的增长。

这是一个”受益于竞争,不受困于竞争”的独特商业位置。

结语:推理时代才是AI的真正商业化阶段

模型训练是AI的研发投入阶段——每次训练代表着一次大规模的算力消耗,产出是一个可以被多次使用的模型。

而推理是AI的商业化阶段——每一次用户与AI对话,每一次企业AI应用被调用,都是一次推理计算,产生实际的商业价值。

全球AI应用的用户量正在从数亿向数十亿迈进,这意味着每天发生的推理次数将以指数级增长。推理基础设施的规模,将最终远超训练基础设施的规模。

在这个背景下,Broadcom的36%涨幅不只是一个股价数据,它是AI产业进入大规模商业化阶段的一个信号灯。在训练时代建立垄断的NVIDIA,将在推理时代面临来自定制芯片、云服务商自研方案的系统性竞争。

这个过渡需要多少年才能完成?没有人知道。但Broadcom跑赢NVIDIA的这一刻,可能正是这个历史转折点的开端。

参考资料

  1. “Top Semiconductor Stock Outpacing Nvidia With a 36% Gain Over 6 Months”, 2026-08-07
  2. NVIDIA Vera Rubin chips begin shipping to cloud providers (AI基础设施, 2026-08-04)
  3. “Intel and AMD Soar 13%, Taiwan Semiconductor Rallies 7% as AI-Chip Stocks Surge”, 2026-07-30
  4. “AMD to Acquire AI Chip Start-up Taalas in Bid to Challenge NVIDIA”, 2026-08-07: (Financial Times, 2026-08-07)
  5. “Anthropic is hiring an AI chip design team”, TechCrunch, 2026-08-05: https://techcrunch.com/2026/08/05/anthropic-is-hiring-an-ai-chip-design-team/
  6. Google Cloud Q2 2026 market share data (Synergy Research Group, 2026-08-06)
  7. “AWS Vs. Microsoft Vs. Google Cloud Earnings Q2 2026 Face-Off”, 2026-08-03
  8. Stanley Druckenmiller Taiwan Semiconductor position (13F filing, 2026-Q2)