200万颗GPU、16年最大升级:AWS与NVIDIA重新划定AI基础设施的算力边界
2026年8月27日,在Nvidia Q2财报公布的同一天,Amazon Web Services和NVIDIA联合宣布了一笔让业界屏息的扩展协议。
核心数字只有一个:200万——AWS将在2027年至2028年间,在全球基础设施中额外部署200万颗NVIDIA GPU。
Jensen Huang对这次合作扩展的定性是”16年来两家公司最大规模的合作扩展”。他说这句话的语气,不像是正常的商业公告,更像是在宣布一个历史节点的到来。
那么,这200万颗GPU代表什么?它将如何改变AI基础设施竞争格局?
规模直觉:200万颗GPU意味着什么
把200万这个数字放到具体语境里,才能感受它的量级。
目前全球最大的AI训练集群(以xAI的Memphis Colossus为代表)大约有10万颗GPU。AWS的这次扩展,相当于计划额外建设20个Memphis Colossus级别的集群,分布在全球各地。
按照Nvidia H100/H200 GPU的当前市价(约每颗3-5万美元),200万颗GPU的设备采购价值大约在600亿至1000亿美元之间——这还不计基础设施建设和运维成本。放在整个AI基础设施投资图谱中,这是一个单笔承诺规模足以改写行业预期的数字。
Amazon官方博客明确写道:这次扩展建立在两家公司16年联合创新的基础上,两家公司一起推出了世界上第一个GPU加速云实例。如今,需求规模已经无法与当年相提并论。
Vera CPU:不只是GPU,更是算力架构的升级
200万GPU之外,这次合作扩展中另一个被低调处理但同样重要的消息是:NVIDIA Vera CPU即将登陆AWS。
Vera是NVIDIA专为Agentic AI工作负载设计的新一代CPU,是Nvidia从”只做GPU”向”提供完整计算节点”战略演进的重要产品。与传统的Intel或AMD CPU不同,Vera是专门为运行AI推理工作负载优化的,与NVIDIA GPU高度协同,在Agentic AI场景下(需要大量连续的AI推理+逻辑操作的复杂工作流)可以显著降低延迟。
Vera CPU进入AWS,意味着企业开发者将拥有一个”原生AI计算节点”的选项——GPU+CPU都来自NVIDIA,通过NVLink高速互联,整个系统从硬件层面就是为AI工作流优化的,而不是把AI工作负载硬塞进传统的通用计算框架里。
这个方向对Agentic AI(多步骤自主任务)尤为重要。ChatGPT或Claude的单次对话,用一个GPU就能处理。但一个自主运行的AI Agent,需要在一个任务链里执行数十到数百次LLM调用,每次调用之间还有逻辑判断、工具调用、状态管理——这种工作负载对CPU和GPU之间的数据传输带宽有极高要求。Vera CPU + Blackwell/Rubin GPU的组合,正是针对这个场景的解法。
政府AI工厂:一个被低调处理的战略信号
在公告的中段,有一个容易被忽略的细节:AWS和NVIDIA将为美国政府建设安全AI工厂,规模是10万颗GPU,安全级别为IL6(影响级别6,用于处理最高机密信息)。
这个细节的意义超出了10万颗GPU本身。
IL6是美国联邦政府最高的云安全认证级别之一,意味着这个AI工厂需要满足极严格的数据隔离、访问控制和合规要求。能在这个级别上同时部署NVIDIA GPU(而不是退一步用替代芯片)的AWS,实际上是在向美国政府市场传递一个清晰的信号:AI算力与国家安全基础设施的整合,已经准备就绪。
背景是:2026年以来,美国政府各机构(军方、情报机构、联邦政府部门)在AI采购上的预算显著增加,但受制于安全认证要求,大多数商业AI平台不能直接用于处理敏感数据。AWS-NVIDIA这个IL6级别的AI工厂,实际上是在建设一条将最先进AI算力引入政府安全域的管道。
NVLink Fusion与Trainium:竞争中的互补逻辑
公告中还提到了NVLink Fusion将与AWS自研Trainium芯片整合。这是一个初看矛盾、细想精明的决定。
Trainium是AWS的自研AI训练芯片,理论上是在与Nvidia的GPU竞争。但AWS选择让NVLink Fusion与Trainium协同工作,这说明在实际的企业部署场景中,”NVIDIA GPU vs. AWS Trainium”并不是一个非此即彼的选择题。
不同的工作负载有不同的最优计算基底:大规模模型训练可能用Trainium成本更低,但推理密集型的Agentic工作流可能在Nvidia GPU+Vera CPU上性能更好。NVLink Fusion作为统一的互联协议,允许这两种芯片在同一个数据中心内无缝协作。
AWS CEO Matt Garman在公告中说的话很值得玩味:”客户希望有自由选择最适合其AI工作负载的工具,并且需要一切都能无缝协同工作。”这句话是AWS多云/多芯片战略的标准台词,但背后的竞争意图很清楚:AWS在试图成为唯一能同时整合NVIDIA和自研芯片的主要云厂商,既不单一依赖Nvidia,也不与Nvidia全面对抗。
与Google和Azure的对比:算力军备竞赛的三方博弈
这次AWS-NVIDIA扩展公告,必须放在三大云厂商的算力军备竞赛背景下理解。
Google Cloud同天宣布,Q2云市场份额同比增加2个百分点(根据CRN数据),而AWS份额有所下滑。Google的增速来自Gemini生态的快速商业化和TPU(自研AI芯片)的效率优势。
Azure(微软)长期绑定OpenAI,通过GPT系列模型的企业端垄断维持算力需求。OpenAI的自研芯片计划(Jalapeño)如果成功,可能会减少OpenAI对Nvidia GPU的依赖——这对Azure和Nvidia都是变量。
在这个三方博弈中,AWS-NVIDIA联合宣布200万GPU,是AWS的一次反击信号:我们在Nvidia GPU部署规模上是业界最大的,而且还在加速扩张。这不只是算力数量的竞争,也是”哪个云平台拥有最完整的AI推理+训练生态”的竞争。
拥有最多Nvidia GPU的云平台,在短期内仍然是最多AI客户的首选,因为Nvidia的CUDA生态锁定了开发者的习惯。AWS通过这次大规模扩展,是在用物理资产布局来抵御Google和Azure的侵蚀。
供应链隐忧:200万GPU,谁来造?
一个无法绕开的现实问题是:Nvidia能否按时交付200万颗GPU?
Nvidia CFO在同天的财报电话会上明确说,公司的最大制约不是需求,而是供应——台积电产能和内存芯片(HBM)都在短缺。2027-2028年的200万颗GPU,意味着台积电必须在当前产能基础上大幅扩张,或者AWS愿意接受分批次交付的较长周期。
这给这次公告增加了一个不确定维度:数字是真实的,但时间表能否兑现,取决于整个半导体供应链是否能跑赢需求。
历史上,科技行业不缺”多少颗GPU部署计划”的公告,但真正按时按量落地的比例并不高。200万颗GPU是2027-2028年的目标,验证它是否成真需要时间。
开放模型战略:AWS不只是NVIDIA的经销商
这次公告中有一个值得细读的措辞:AWS不仅承诺部署200万GPU,还强调”这次扩展补充了Amazon自有定制芯片,给客户自由选择最适合工作负载的算力”。
这句话揭示了AWS在AI算力竞争中的差异化定位:平台中立性(Platform Neutrality)。AWS不打算成为”Nvidia独占云”,也不打算成为”只卖自研Trainium”的封闭园区。它的策略是同时提供最多种类的算力选项,让客户在不更换云平台的前提下,随时切换到最合适的芯片。
从公告来看,AWS当前支持的AI算力选项包括:
- NVIDIA H100/H200/Blackwell/Rubin系列 GPU
- NVIDIA Vera CPU(新增)
- AWS自研Trainium(训练优化)
- AWS自研Inferentia(推理优化)
- AMD GPU(通过EC2 G5实例)
这种”算力超市”策略与Google和Azure的路径形成鲜明对比:Google全力押注自研TPU,Azure深度绑定Nvidia(通过OpenAI合作),两者都有明显的单一赌注风险。AWS的多元算力策略降低了供应商集中风险,但同时也意味着每种芯片的优化深度都不如专注单一芯片的竞争对手。
对企业客户来说,这种”选择自由”是有真实价值的——特别是对于跨越多种AI工作负载的大型企业(同时有大模型训练、推理服务和Agentic任务处理),不同任务可以路由到最优的芯片类型。
AI原生基础设施:为什么”传统云”无法满足Agentic AI需求
这次扩展公告的深层技术理由,是现有云基础设施的局限性在Agentic AI时代变得越来越明显。
传统云基础设施的设计假设是:工作负载要么是”训练”(超大批次计算,高吞吐低实时性),要么是”推理”(单次请求,低延迟高并发)。这两种模式在过去的大多数AI应用中足够了。
但Agentic AI带来了第三种工作负载模式:连续自主推理链(Continuous Agentic Inference Chain)。一个Agentic工作流可能需要:
- 调用LLM进行计划分析
- 调用工具(搜索、代码执行、API)
- 处理工具返回结果
- 重新调用LLM做动态决策
- 重复上述循环数十到数百次,直到任务完成
这种工作负载的特点是:LLM推理次数多、每次推理规模中等(不需要最大的集群)、CPU与GPU之间的数据交换极频繁、对整体端到端延迟敏感(每个子步骤的延迟都会叠加)。
传统架构里,CPU和GPU通常通过PCIe总线连接,带宽有限、延迟明显。NVLink Fusion + Vera CPU的组合,提供了GPU-CPU直连的高带宽低延迟通道,专门针对这种频繁切换的工作负载做了优化。AWS选择在这个时间点引入Vera CPU,正是因为Agentic AI工作负载的爆发让传统CPU-GPU架构的瓶颈变得无法忽视。
从云厂商的角度:为什么AWS愿意押注200万颗Nvidia GPU
在外界看来,AWS和Nvidia是竞争对手——AWS的Trainium和Graviton是自研AI芯片,理论上替代了对Nvidia的依赖。那么,AWS为什么还要押注200万颗Nvidia GPU?
答案在于客户的实际需求远比”Nvidia vs. AWS自研芯片”的二元框架复杂。
首先,不同工作负载对芯片类型有不同的最优解。大规模语言模型预训练(比如从头训练一个百亿参数模型)在AWS Trainium上的性价比可能优于Nvidia H100,但推理工作负载(特别是实时响应的Agentic AI任务)在Nvidia GPU的CUDA生态和低延迟架构上性能更强。对于同时需要训练和推理能力的企业客户,同时提供Trainium和Nvidia GPU的AWS,比任何只提供单一芯片类型的云厂商更具吸引力。
其次,生态系统锁定的反向利用。CUDA的开发者生态锁定了AI开发者,意味着大量生产级AI应用直接运行在CUDA基础上。如果AWS不提供强大的Nvidia GPU选项,这些已经用CUDA构建的应用就会去Google Cloud或Azure运行,AWS会失去市场份额。与其让竞争对手收割CUDA生态的用户,不如自己提供最丰富的Nvidia选项,把这些用户留在AWS内,然后慢慢引导他们试用Trainium。
第三,政府和高安全需求客户的强制性需求。对于需要在隔离安全环境中运行最先进AI工作负载的政府机构(IL6安全级别),他们无法使用中国芯片,Nvidia GPU是唯一可信任的先进AI算力来源。AWS在这个细分市场的竞争优势直接来自其Nvidia GPU的部署规模和安全认证——这是自研芯片暂时无法替代的位置。
地缘政治因素:美国政府和AI算力安全的新逻辑
公告中”为美国政府建设含10万GPU的安全AI工厂(IL6级别)”这个细节,需要放到更大的地缘政治背景中理解。
2026年,美国政府对AI的态度正在经历一个根本性转变:从”谨慎评估、管控风险”转向”积极部署、战略竞争”。驱动这一转变的是来自中国的AI竞争压力——北京在AI基础设施上的投入(2026年1-7月同比增长81.8%)和中国AI模型的能力飞跃,让华盛顿意识到在AI基础设施建设上落后意味着战略上落后。
这种焦虑催生了对”主权AI算力”的需求:美国政府希望拥有不依赖外部供应链、在本土安全基础设施上运行的大规模AI算力。而AWS与Nvidia合作建设的IL6安全AI工厂,正好满足了这一需求。
更深层的含义是:美国政府进入AI基础设施市场,不是作为普通客户,而是作为战略性需求方。这种需求受政策驱动而非ROI驱动——一旦政府决定在AI基础设施上投入,这种需求的稳定性远高于商业需求,不会因为市场周期而大幅波动。这为AWS的长期GPU需求注入了一个稳定的政府基本盘。
深度分析:NVLink Fusion的战略意义
NVLink Fusion是这次公告中技术含量最高、但被媒体关注最少的细节之一。
理解NVLink Fusion,需要先理解AI数据中心的演进趋势。在2020-2024年的第一代AI数据中心里,算力组织相对简单:一批相同型号的GPU通过NVLink互联,形成一个训练集群。这种同质化架构适合大模型训练,但在推理和Agentic AI场景下效率低下。
2025年以后,AI数据中心开始走向异构算力的方向:不同类型的芯片(NVIDIA GPU、自研加速器、CPU)在同一个数据中心内协同工作,每种芯片处理最适合自己的工作负载。这种异构架构的挑战是:不同芯片之间的数据传输如何做到足够快、足够高效?
NVLink Fusion的作用,是把NVLink的高带宽互联能力(一直是Nvidia数据中心系统的关键优势)扩展到异构芯片环境——不只是Nvidia GPU之间互联,而是让Nvidia GPU、AWS Trainium、Vera CPU之间都可以通过NVLink的高速通道交换数据。这在技术上允许”混合算力节点”:一个AI推理任务可以在Trainium上执行粗粒度计算,中间步骤传给Nvidia GPU做精细推理,结果再通过Vera CPU做上层逻辑处理,整个过程的数据传输延迟最小化。
对AWS来说,NVLink Fusion意味着它可以在不放弃Nvidia生态的情况下,推进自研芯片的采用。对Nvidia来说,NVLink Fusion把自己的互联标准变成了异构算力的”总线标准”——即使竞争对手芯片进入数据中心,它们都需要通过Nvidia定义的互联协议来协作。这是一种优雅的生态控制逻辑。
Agentic AI需求:为什么AI工作负载需要新的算力架构
200万GPU的规模公告背后,有一个技术驱动因素值得专门解释:Agentic AI对算力架构的独特需求。
传统的AI推理工作负载是离散的:用户输入→模型处理→输出。每次请求相对独立,算力使用呈现突发性高峰和低谷的特征。
Agentic AI工作负载不同。一个自主Agent在执行一项任务时,可能需要连续调用LLM数十到数百次,每次调用之间有工具调用、状态更新、逻辑判断。这种工作负载的特征是:中等密度的持续计算,而非瞬间的高峰计算。它对CPU和GPU之间的通信带宽提出了极高要求,因为工具调用、状态管理是CPU任务,而LLM推理是GPU任务,两者之间需要频繁高效地交换数据。
传统的PCIe连接架构(CPU通过PCIe总线连接GPU)在Agentic AI场景下会成为瓶颈——PCIe的带宽和延迟不足以支撑高频的CPU-GPU数据交换。这正是Vera CPU + NVLink架构的价值:通过高速直连,消除Agentic AI工作流中最大的数据传输瓶颈。
AWS宣布引入Vera CPU,不只是增加一种芯片选择,而是宣布自己的基础设施已经为Agentic AI的主流化做好了准备。随着Agentforce这类产品(AWS等AI工作流平台的大型客户)的使用量增长,这种Agentic AI专用基础设施的需求会快速上升。200万GPU的规划,从某种程度上说,是在为这波需求提前备货。
执行层面:200万GPU的实际部署挑战
从宣布到交付,200万GPU的实际部署会面临哪些挑战?
供应链挑战:Nvidia当前最大的约束是台积电产能和HBM内存。如果2027年这两个瓶颈没有得到缓解,200万GPU的交付时间表可能延后。AWS应该已经在公告发布前确认了与Nvidia的供应保障——否则这种规模的公告会引发严重的合同法律风险。但”公告的承诺”和”实际交付的速度”之间,仍然存在现实的不确定性。
功耗和散热挑战:200万颗Nvidia H200/Blackwell级别GPU的平均功耗约500-700W,200万颗GPU的总功耗是100-140万千瓦——相当于多个大型城市的峰值用电量。部署到AWS全球基础设施意味着需要在多个区域分散这个功耗,每个数据中心都需要电力基础设施的升级(变压器、UPS、冷却系统)。这是一个和芯片供应同等重要的基础设施挑战,但通常不出现在公告标题里。
软件和管理层面:200万颗GPU如何被高效调度和利用,是一个需要世界级软件工程的问题。AWS目前使用EFA(Elastic Fabric Adapter)和自研网络技术管理大规模GPU集群,但在这个规模上,任何调度策略的改进(比如提高GPU利用率从70%到75%)都相当于多出几万颗GPU的等效算力。
这些挑战不会阻止目标实现,但会影响实现的速度和实际的客户体验质量。投资者和客户在评估这条公告时,需要把这些”最后一英里”挑战纳入自己的时间表预期。
从科技史看这次扩张的历史坐标
把AWS-NVIDIA这次200万GPU合作放到科技史的坐标轴上,会发现一个有趣的规律:基础设施的跨越式扩张,往往先于应用爆发1-2年。
2006-2007年,AWS推出EC2和S3,开始大规模建设云基础设施,彼时大多数企业还不知道什么是”云原生”。2010-2011年,移动应用爆发,Uber、Instagram、Airbnb等应用都建立在AWS这个已经成熟的云基础设施上。基础设施先行2年,应用后来居上。
2026年的AWS-NVIDIA 200万GPU扩张,遵循的是同一个模式:在Agentic AI应用大规模爆发之前(可能在2028-2029年),先把基础设施建好。那些真正改变行业的Agentic AI应用——比如全自主的制造业控制系统、无需人工干预的科研实验室、完全AI驱动的销售团队——需要的算力规模,将远超今天所有生产部署的总和。
200万颗GPU,是AWS在为这个还未到来的未来预先储备弹药。
结语:基础设施投入是AI时代最慢但最重要的赌注
基础设施建设是AI竞争中节奏最慢、但胜负影响最深远的那一层。模型可以在几个月内被对手追上,但200万颗GPU的部署,形成的规模经济和客户依赖是持久的护城河。
这是一场以十亿美元为单位、以年为时间刻度的长期赌注。AWS和Nvidia把筹码推进桌子中央了,现在要等时间来证明这笔赌注是否物超所值。
对整个AI行业来说,这次扩张公告最重要的意义可能不是200万颗GPU本身,而是它所代表的信号:在AI基础设施竞争中,没有”等等看”的选项。行动越早,护城河越深。AWS和Nvidia用行动证明了这一点——其他人的选择,要么跟进,要么让出市场份额。
参考资料
- “AWS and NVIDIA to deploy 2 million more GPUs for AI in 2027-2028”,Amazon官方博客,2026年8月27日:https://www.aboutamazon.com/news/aws/aws-nvidia-2-million-gpus-ai
- Nvidia Q2 FY2027财报CNBC报道,2026年8月27日:https://www.cnbc.com/2026/08/27/nvidia-nvda-q2-earnings.html
- “Nvidia rises after signaling longer AI spending runway”,Reuters,2026年8月27日:https://www.reuters.com/business/nvidia-rises-after-signaling-longer-ai-spending-runway-2026-08-27/
- “Cloud Market Share Q2 2026: Google Gains Share As AWS Falls”,CRN:https://www.crn.com/news/cloud/2026/cloud-market-share-q2-2026-google-gains-share-as-aws-falls
- AWS Strategic Collaboration with NVIDIA:https://www.aboutamazon.com/news/aws/amazon-aws-nvidia-collaboration
基础设施战争从来不是一场可以保持观望的战争。AWS和Nvidia用这份200万GPU的承诺,定义了2027-2028年AI算力格局的基准线。谁在这条线之下,谁就在AI时代最关键的能力赛道上落后了——而在这场游戏里,追赶的代价往往远高于先行的成本。
给企业CIO的决策框架:如何在AWS-NVIDIA扩张公告中寻找战略信号
这次公告传达了几个对企业技术决策者有直接价值的信号。
信号一:2027年的云算力供应会比今天更充裕。AWS明确承诺2027-2028年新增200万GPU,配合全球其他主要云厂商的同步扩张,意味着AI算力的供应约束会在未来12-24个月内得到缓解。如果你的公司现在因为GPU资源不足而限制了AI项目的进展,2027年的供应改善会打开新的窗口——但这也意味着竞争对手同样会得到更多算力,AI竞争强度会加剧。
信号二:Agentic AI基础设施已经开始大规模准备。Vera CPU、NVLink Fusion、10万GPU政府AI工厂——这些都是Agentic AI(多步骤自主任务)的基础设施准备。如果你的公司正在规划2027年以后的AI Agent自动化部署,现在与云厂商谈长期协议并提前进行基础设施评估,是明智的行动。等到2027年Agentic AI的成熟应用大量涌现时,基础设施能力将成为关键竞争壁垒。
信号三:开始评估哪类工作负载适合Nvidia GPU,哪类适合自研芯片。随着AWS提供更丰富的芯片选择(Nvidia + Trainium + Inferentia + Graviton),选择”最优算力”而不是”默认算力”的机会来了。大批量低延迟推理(Inferentia)、大规模模型训练(Trainium)、复杂实时推理(Nvidia GPU)的最优选择是不同的。开始构建多芯片工作负载评估能力,是AI基础设施成熟度的重要标志。
总体而言,AWS和Nvidia的200万GPU公告不只是一个数字,它是一张关于AI基础设施2027-2028年图景的路线图。读懂这张路线图,并据此调整自己组织的AI投入节奏和方向,是当下技术领导者最值得做的工作之一。
在科技产业的历史上,最重要的基础设施投资决定,往往不是在需求已经明确的时候做出的,而是在需求已经初露端倪、但大多数人还在观望的时候做出的。互联网光纤、云计算、移动基站,都是这样的赌注。AWS和Nvidia今天的200万GPU承诺,遵循的是同一个逻辑:AI算力的真正爆发需求还没有到达,但它一定会来,而到那时最重要的能力储备,必须现在就开始建设。
未来两年,这200万颗GPU将陆续上线,为从科研实验室到政府国防系统的各类AI工作负载提供算力。它们是目前已知的,关于AI基础设施规模边界的一次最清晰的公开承诺。这也是我们可以依据的,评估AI算力扩张方向的最具体坐标。
更深层的问题:为什么这次合作超越了单纯的商业协议
AWS和Nvidia的200万GPU合作,从表面上看是一份采购协议,但从更深的战略层次分析,它实际上是两家公司在以协调一致的方式应对AI基础设施竞争中的根本挑战。
挑战一:算力的碎片化威胁。随着Google的TPU、Amazon的Trainium、微软的Maia、OpenAI的Jalapeño等自研芯片相继出现,AI算力市场正在走向碎片化——不同的芯片有不同的编程模型,应用开发者需要为不同的芯片优化不同的代码。这种碎片化会显著增加AI应用的开发和部署成本。AWS和Nvidia通过深度整合(NVLink Fusion + CUDA + Trainium协同),实际上是在建立一个”统一计算平台”的选项,让用户在AWS上可以透明地使用不同芯片而不需要关心底层差异。
挑战二:AI算力的可信性问题。对政府客户和安全敏感的企业来说,AI算力的可信性(供应链安全、数据主权、访问控制)和性能同等重要,甚至更重要。AWS通过其合规认证体系(FedRAMP、IL6、SOC2 Type II等)为Nvidia GPU提供了一个安全可信的运行环境——这是Nvidia自己无法单独提供的能力,也是AWS对Nvidia合作价值最关键的补充。
挑战三:AI算力的可扩展性问题。从10颗GPU的研究集群到10万颗GPU的生产集群,中间有巨大的工程复杂度。AWS的数据中心工程、网络基础设施和运维自动化能力,是让Nvidia GPU在大规模场景下真正发挥价值的”最后一公里”。没有AWS这样的云运营商,Nvidia的GPU只是昂贵的硬件;有了AWS的基础设施,这些GPU变成了企业可以按需使用的弹性AI算力。
理解这三个深层挑战,才能理解为什么这次合作对两家公司来说都是”双赢得不能再双赢”的安排:AWS获得了最先进、覆盖最广的AI算力选项;Nvidia获得了最可信、最成熟的云交付平台。在AI基础设施战争中,这个组合是当前最强的入场组合之一。