2200亿美元遇上折旧危机:Amazon Trainium 2被提前替换,整个行业的CapEx逻辑需要重写
2026年8月,Business Insider拿到了一份令人不安的内部文件。
Amazon正计划在印第安纳州的数据中心,用下一代Trainium 3芯片替换仅部署了约20个月的Trainium 2服务器。
这不是常规的技术迭代叙事。这是一个关于AI硬件投资周期根本性错乱的信号。
就在同一周,Andy Jassy在2026年Q2财报电话会议上告诉华尔街:”我们今年将花掉2200亿美元,但仍然无法满足需求。”
两件事叠加在一起,形成了一个没有人真正想公开讨论的矛盾:当最大的AI基础设施投资者开始提前报废自己的硬件,这场以千亿美元为单位的豪赌,是否从一开始就建立在一个错误的假设之上?
第一章:内部文件揭示的决策
根据Business Insider于2026年8月报道的内部文件,Amazon印第安纳州数据中心的改造计划包含两个同时推进的目标。
第一个目标是将多栋独立的建筑合并为一个统一的”AGI超级集群”,也就是一个专为大规模人工智能训练和推理优化设计的超大规模计算设施。这种架构改造不是简单地增加机器数量,而是从底层重新定义数据中心的互联逻辑。
第二个目标,就是替换Trainium 2。
Trainium 2是Amazon于2024年底开始大规模部署的自研芯片,专门针对机器学习训练任务。在正式推出时,Amazon宣称它在成本效益上具有明显优势。但现在,部署不到两年,它就要被新一代产品取代。
做一道简单的折旧数学。企业IT基础设施的标准折旧周期通常是三到五年。按三年计算,20个月之后替换,意味着超过44%的账面价值还没有折旧完就被废弃。按五年计算,废弃的比例更高达67%。
一台成本百万美元的AI计算节点,在不到两年内就失去了生命周期价值,这不是会计部门能简单处理的问题。这是一个战略层面的问题:在AI芯片每隔18到24个月就发生代际性能跃迁的时代,传统的资本支出规划框架,是不是从根本上就设计错了?
Yahoo Finance援引分析师的判断:如果Amazon今天花出去的2200亿美元,有相当一部分将在两年内面临大规模折旧,那么整个投资的回报率预测,是否需要根本性地重新建立?
这个问题目前没有被市场认真回答。
第二章:为什么要建AGI超级集群,为什么现在
理解为什么Amazon要提前替换,需要先理解AGI超级集群究竟需要什么。
传统的云计算数据中心,底层逻辑是”分散独立”:大量服务器各自处理独立的任务,彼此之间不需要密集的实时通信。推理任务尤其如此,每个用户的查询基本上是独立的计算单元。
但大规模AI训练,特别是以AGI为目标的超大规模训练,需要完全不同的架构。数以万计的计算芯片必须在极短的时间窗口内,同步交换海量的中间计算结果。这对芯片之间的通信带宽要求极高,对整个集群的物理布局也有特殊要求:芯片与芯片之间的物理距离,直接影响通信延迟和训练效率。
这就是为什么要把多栋建筑合并。不只是为了规模,而是为了互联。
Trainium 2在2024年设计时,对标的是当时已知的最大模型训练规模。但从2024年到2026年,模型规模和训练需求的增长速度,超出了当时的预期。更重要的是,Amazon对”AGI训练”的判断,已经将目标规模提升到了一个Trainium 2无法有效支撑的量级。
这是一个合理的逻辑:用错误规格的硬件建错误规格的集群,等到发现问题再改造,代价更高。与其在一个性能受限的集群上多跑两年,不如现在就用正确的硬件打好基础。
Business Insider的报道还揭示了一个关键细节:Amazon的Trainium 2算力,有相当大一部分被用于支撑Anthropic的推理工作负载。
Amazon已经向Anthropic累计投入超过40亿美元,并将AWS定位为Anthropic的核心算力合作伙伴。这意味着Amazon购置Trainium 2,不只是用于自己的AI开发,同时也是在向最重要的战略投资对象出租算力,支撑Claude系列模型向全球用户提供服务。
于是出现了这样一个逻辑闭环:Amazon购置Trainium 2,将算力出租给Anthropic,Anthropic用这批算力运行Claude推理,产生的收益通过云服务费回流Amazon,Amazon再用这笔钱购置Trainium 3。在整个循环里,Amazon是设备的买方、算力的卖方、客户的战略股东。Trainium的折旧周期,直接嵌入了整个循环的经济效率计算中。
第三章:不只是Amazon的问题
Trainium 2的困境,是整个AI基础设施行业正在经历的缩影。
先看微软。Azure上部署了数量可观的英伟达H100芯片,是OpenAI的主要基础设施提供商,也是Copilot系列产品的算力后盾。2026年,英伟达Vera Rubin,也就是H100的后续产品,开始向云服务商出货,并承诺推理成本比Blackwell低10倍。微软面临一个没有好答案的选择:继续让OpenAI在H100上运行,意味着推理成本持续高于转型到Vera Rubin的竞争对手;立即替换,意味着大规模的迁移成本和服务中断风险。H100从2023年大规模部署,到2026年约三年。三年内就出现了成本效率上10倍差距的继任产品,这意味着微软在Azure AI算力上的硬件有效生命周期,正在被压缩到三年以内。
再看谷歌。自研TPU芯片线在技术路线上保持了独立性,但每一代TPU升级都带来存量集群的折旧问题。TPU v5和TPU v6之间的性能差距,意味着已经部署的旧一代节点的经济寿命在缩短。谷歌在全球数据中心运行着大量TPU v4和v5节点,这批资产面临与Amazon Trainium 2同样的压力。
三家一起看。亚马逊、微软、谷歌这三家在2023到2026年间,合计在AI基础设施上的投入超过5000亿美元。每一笔投入背后,都有一个隐含的回收假设:硬件的有效使用寿命足够长,云服务的定价能够覆盖折旧并实现盈利。
如果这个假设里的”足够长”,从原来的五年压缩到了两年,那么云服务商需要在更短时间内摊销同等数量的硬件成本。这只能导向两个后果:要么涨价,损害企业客户的AI应用ROI,拖慢整体AI落地节奏;要么接受更低的毛利率,损害股东回报,增加下一轮资本投入的融资难度。
两个选择都不让人满意。这才是Trainium 2事件真正的系统性含义。
第四章:市场为什么还没有定价这个风险
这个问题的奇怪之处,在于市场目前似乎并不在乎。
AWS第二季度营收422亿美元,同比增长约19%,超出预期。亚马逊股价上涨。英伟达本周也收涨超10%,半导体指数同期涨逾8%。在所有人都在讨论AI算力需求旺盛的叙事语境下,AI基础设施的折旧风险,几乎没有出现在主流的估值讨论中。
为什么?
部分原因是信息的不透明。企业的硬件折旧决策大多藏在内部文件里,Business Insider能拿到这份资料,属于相对罕见的信息泄露。大多数时候,投资者看到的是整合后的资本支出数字,看不到具体的硬件替换决策。
另一部分原因是增长预期的压制效应。只要AI应用的货币化速度足够快,硬件折旧加速就可以被增长溢价吸收。这是一个自我强化的信念:只要相信AI会带来足够多的新业务,就可以接受更高的折旧损失,因为未来的收益会覆盖它。
但这个逻辑有一个脆弱性:它假设AI应用的货币化速度,将持续快于硬件折旧的速度。如果企业AI应用的ROI证明在某个时点出现系统性困难,折旧压力就会从被掩盖的状态突然变得可见。
2000年前后的电信基础设施泡沫提供了一个参照,但两者差异显著,不可直接类比。当时,运营商为了应对互联网需求,铺设了远超实际使用量的光纤网络。当需求无法跟上投资节奏时,大规模资产减值引发了行业危机。AI基础设施与光纤的根本差异是需求的真实性:AI算力是在被使用的,不存在光纤时代那样严重的闲置。但硬件折旧周期被技术迭代强制压缩的结构性逻辑,具有某种相似性,值得被认真对待,而不是因为增长叙事响亮就直接跳过。
第五章:谁在折旧危机中受益,谁在承担损失
折旧周期缩短不是所有人的噩梦。不同的市场位置,决定了完全不同的命运。
最大的受益者是芯片制造商,首先是英伟达。每一次云厂商的硬件替换周期,都意味着新芯片的采购需求。A100退场给H100让路,H100被Blackwell取代,Blackwell被Vera Rubin超越,每一次更替英伟达都是卖方。Trainium 2被Trainium 3取代,是Amazon内部竞争,英伟达暂时不是直接受益方;但如果Amazon的Trainium 3研发进度延迟或性能不如预期,Amazon将不得不大规模采购英伟达芯片作为过渡方案。这对英伟达来说是一个双向的潜在机会。
第二类受益者是电力和数据中心基础设施公司。每一次AI芯片的代际更替,都触发新一轮的数据中心建设和改造需求。AGI超级集群对芯片间通信带宽的超高要求,意味着定制光纤、高带宽交换机、液冷散热系统的大规模采购。这种基础设施层面的需求,与上层的芯片品牌竞争无关,是一个更稳定的结构性机会。
主要的承压方是已签订中长期云算力合同的企业用户。那些在2024到2025年签订了两到三年AI算力合同的公司,定价是基于Trainium 2和H100的成本结构。当云厂商完成新一代硬件的迁移,新客户可以以更低价格获得更强的算力能力,而老合同客户在合约期内无法同步享受这个成本红利。这不是绝对损失,但是相对于新进入者的机会成本在扩大,这种不平衡会在合同续约时以更明显的方式体现出来。
第六章:这个决策是否正确
有一个值得独立讨论的问题:Amazon提前替换Trainium 2,到底是被迫的,还是主动的选择?
从竞争逻辑来看,这个决策体现了一种被迫的理性。在AI技术以当前速度迭代的市场里,”继续用旧芯片”不是一个稳定可持续的选项。它意味着在与其他AI基础设施提供商的竞争中,持续承受算力性能和成本效率的双重劣势。Amazon在相对有限的折旧损失和长期的竞争落后之间,选择了前者。
从可持续发展的角度看,存在一个有趣的悖论。提前废弃可用硬件,从直觉上违背了资源节约的原则。但如果新一代芯片在同等计算任务上的能耗大幅降低,从全生命周期的碳排放来看,提前迁移反而可能降低总体环境成本。这个问题没有简单的答案,需要具体的能效数据才能客观评估。
更深层的问题是:Amazon的这个决策,是否意味着整个行业正在形成一种新的资本支出心态?也就是说,不再以”这台硬件能用多少年”来规划投资,而是以”下一代硬件多久会出现”来设定更换预算。如果这种心态成为主流,AI基础设施行业的资本支出节奏将进一步加速,而不是趋于稳定。
结语:2200亿美元的真实成本
Andy Jassy的那句”2200亿美元仍然不够”,是一个关于需求旺盛的乐观陈述。华尔街接受了这个判断,AI算力投资的热情没有减退的迹象。
但Business Insider拿到的内部文件,为这个叙事添加了一个通常被省略的脚注:那2200亿美元里,有一部分钱已经在被20个月前的采购决策所消耗。这不是因为当初的决策是错的,而是因为AI技术的迭代速度,让任何时点的大规模硬件投资都面临”在被下一代超越之前能否回收成本”的宿命性压力。
这是AI基础设施投资的新常态。接受它,并且在财务模型里如实反映它,比在叙事上回避它更重要。
从这个意义上说,Trainium 2事件不是Amazon的失误,而是整个行业的一次集体性预警:在AI时代,资本支出不是一次性的战略赌注,而是一条没有终点的跑步机。今天的2200亿美元,只是维持当前竞争地位的门票价格。明年,这张门票的面值,很可能已经不够用了。
深度分析:为什么折旧问题被系统性低估
在讨论AI基础设施的折旧问题时,有一个认知偏差值得特别指出。
大多数关于AI基础设施的分析,都聚焦在需求侧:有多少公司在用AI,AI应用的渗透率在提升,企业AI预算在增加。这些数据是真实的,也是积极的。但它们遮蔽了供给侧的一个关键动态:硬件的有效生命周期正在系统性地缩短。
区分这两件事很重要。需求增长是AI行业的利好因素,证明了AI的商业价值。供给侧硬件折旧加速是一个独立的风险因素,与需求增长是否旺盛并没有直接的对冲关系。事实上,需求越旺盛,芯片制造商就越有动力加快新一代产品的推出,而新产品的出现又进一步压缩了上一代产品的有效生命周期。这是一个自我强化的循环,会持续压缩折旧周期,而不是让它稳定下来。
历史上,IT基础设施的资本化支出模型,建立在一个相对稳定的硬件迭代周期之上。服务器的迭代节奏以多年计,网络设备的更换周期以五到七年计。这种稳定性使得云服务商可以建立清晰的定价模型:确定每个计算单元的成本,加上折旧和运营费用,设定合理的利润率。
AI芯片打破了这个稳定性。当迭代周期从五年压缩到两年,整个成本模型都需要重写。而云服务商目前的定价,仍然在一定程度上反映的是旧的折旧假设。
这种定价滞后,是未来利润率压力的潜在来源。
行业规律:芯片代际跃迁正在加速
理解Trainium 2为什么只用了20个月就面临替换,需要理解整个AI芯片行业当前的迭代节奏。
英伟达的数据提供了一个参照系。从H100到H200,主要是内存带宽的升级,间隔约12到18个月。从H200到B200,是整体架构的重大升级,性能提升幅度更大。从Blackwell到Vera Rubin,英伟达宣称推理成本降低10倍,这是在硬件层面极为罕见的数量级跃迁,通常需要3到5年才能实现,但这次发生在约两年时间内。
英特尔、AMD、谷歌、亚马逊、微软各家的自研芯片也在加速迭代,因为每家都意识到:在AI计算时代,硬件是最重要的护城河之一,必须以最快的速度占据代际优势。
这种集体性加速竞争的结果,是芯片有效生命周期的系统性压缩。对于最终购买这些芯片的企业来说,无论是直接购买自建数据中心,还是通过租用云算力间接承担,折旧成本都在以越来越快的速度侵蚀投资回报。
Amazon内部文件披露的Trainium 2替换计划,是这种行业规律在具体公司层面的具体体现。它的特别之处,在于通过内部文件的形式让这个通常不可见的决策变得可见,使得公众有机会直接观察到折旧压力如何转化为公司内部的实际行动。
对企业AI采购决策的启示
如果你是一家正在评估企业AI投资的公司,Amazon Trainium 2事件提供了几个值得参考的判断框架。
第一,在与云服务商签订长期算力合同时,需要更仔细地考虑合同期内硬件代际更替的可能性。2025年签订的两年合同,极有可能在合约到期前,云厂商已经完成了下一代硬件的大规模部署,而你的定价锁定在了旧一代的成本结构上。这不是说长期合同是错的,而是说在谈判时应当争取更多的硬件升级收益传递条款。
第二,对于自建数据中心的企业,AI硬件的折旧周期必须比传统IT设备设置得更短。按照传统的五年折旧计划购置的AI加速卡,很可能在三年内就已经在性能上大幅落后于市场最新产品。这意味着会计处理上的折旧年限和真实的经济使用周期之间,存在系统性偏差。
第三,对于那些使用AI算力提供服务的企业,应当定期重新评估自己的算力成本基线。如果竞争对手已经迁移到了新一代算力,而你仍然在使用两代之前的硬件,这个成本差距会在服务定价上逐渐体现出来,成为竞争劣势。
这些建议不是悲观主义。AI带来的真实商业价值是存在的,折旧压力并不意味着AI投资是错误的。但在制定AI投资计划时,将硬件折旧加速作为一个正式的风险因子纳入考量,而不是用增长乐观预期将其模糊掉,是更审慎也更负责任的做法。
参考资料:
- Amazon’s $220 billion AI bet hits a snag: Trainium 2 chips already being replaced, Yahoo Finance / Moneywise, 2026-08-07 - https://finance.yahoo.com/technology/ai/articles/amazons-220-billion-ai-bet-163500285.html
- Business Insider internal documents on Amazon Indiana data center AGI SuperCluster, 2026-08
- Amazon Q2 2026 Earnings, AWS $42.2B quarterly revenue - https://ir.aboutamazon.com/news-releases/
- NVIDIA Vera Rubin chips begin shipping to cloud providers, GCN, 2026-08-04 - https://gcn.com/nvidia-vera-rubin-chips-begin-shipping/20421/
- Nvidia ends week up more than 10% as AI chip fears ease, Yahoo Finance, 2026-08-07 - https://finance.yahoo.com/technology/article/nvidia-ends-week-up-more-than-10-as-ai-chip-fears-ease-205751147.html