Decathlon用AI预测需求的秘密:Chronos-2如何解决全球最大体育零售商的「预见未来」难题

零售业最古老的难题不是如何卖货,而是如何提前知道该备多少货。备多了,资金被占压,仓库堆满;备少了,货架空空,顾客转向竞争对手。这个问题折磨了零售从业者几个世纪,直到人工智能出现,才终于有了系统性解决的可能。

2026年8月28日,全球最大体育用品零售商迪卡侬(Decathlon)与亚马逊云服务联合发布了一篇技术博客,详细描述了他们如何将时序基础模型Chronos-2部署到全球规模化需求预测系统中。这篇博客的技术含量极高,但它真正的价值不在技术细节本身,而在于它展示了一个跨越100个市场、服务4亿用户的全球零售巨头如何将基础模型从实验室带入生产环境——以及这个过程中发现的深刻教训。

迪卡侬的预测难题:规模、多样性、季节性的三重挑战

迪卡侬不是一家普通的零售商。它在全球拥有超过10万名员工,服务超过4亿用户,销售覆盖80多种运动、数万个单品,从欧洲横跨至亚洲、拉丁美洲和中东地区。这种规模意味着其需求预测系统需要解决的问题,复杂程度远超大多数零售商遇到的情形。

需求预测系统需要每周对所有产品进行预测,同时针对两个关键时间窗口:一是12周的补货窗口,用于指导采购规划员从工业合作伙伴处订货;二是52周的战略窗口,用于长期库存规划和产能预测。这套系统每周运行一次,覆盖欧洲、印度、中国、东南亚、拉丁美洲以及即将加入的中东和非洲地区,每个供应区域最多需要处理2.5万个产品的预测任务。

迪卡侬面临的预测挑战有三个维度特别突出。

第一是产品多样性的极端化。一双滑雪手套和一块冲浪板,它们的需求信号几乎没有任何共同点——前者需求高度依赖冬季和降雪条件,后者依赖海岸线分布和夏季气候;前者的周期性极强,后者的地域性极强。同一套预测逻辑无法有效覆盖这两类产品,但迪卡侬的系统必须同时处理它们,以及80多种运动的数万个类似对比。

第二是季节性模式的复杂性。体育用品的需求受季节影响极大,但季节的影响因地区而异:中国的体育消费高峰与欧洲的不同,东南亚全年无冬的气候使某些产品的季节性模式与欧洲完全相反。跨越如此多样的气候带和文化背景,构建准确的季节性模型本身就是一项艰巨任务。

第三是新产品和新市场的冷启动问题。迪卡侬持续推出新产品,并且在不断扩展新的地理区域。新产品没有历史数据,新市场没有区域行为基准——这种”冷启动”场景是传统需求预测模型的软肋:没有历史就无法外推。

这三重挑战的叠加,使迪卡侬的需求预测问题成为零售行业里公认的最复杂案例之一。

从DeepAR到Chronos-2:五年技术演进的方向

迪卡侬的需求预测技术体系经历了五年的系统性演进,这段历史本身就是零售AI技术发展的缩影。

2021年至2024年,迪卡侬使用混合方法:亚马逊SageMaker的DeepAR模型负责短期预测(1到16周),Holt-Winters指数平滑法负责长期预测(17到52周)。DeepAR每周重新训练,以适应最新的趋势变化。这套方案在技术上是当时的最佳实践,但有几个痛点始终没有根本性解决:系统需要每周重新训练,运维开销巨大;扩展到新地区需要大量额外的工程工作,因为每个区域的数据特征差异太大;虽然能处理大多数场景,但在冷启动和数据稀疏产品上的表现始终不够理想。

2024年,迪卡侬引入了时序融合转换器(TFT),通过增加协变量(如天气、促销日历等外部因素)提升了长期预测精度。TFT是一次有意义的进步,但同时也带来了新的复杂性:需要管理和更新大量协变量数据,需要为不同地区和产品类别设计不同的协变量组合。

时序基础模型的兴起带来了一个根本性的不同思路:如果一个预先训练好的模型,通过在海量时序数据上的训练,已经内化了”时序数据的通用模式”,那么它理论上可以在不需要大量领域特定训练数据的情况下处理新的预测任务——包括冷启动问题。

但一个关键问题始终存在:这些声称具有通用能力的时序基础模型,真的能在迪卡侬这么特殊的零售数据集上表现好吗?理论上的通用性是否能经得住现实数据的检验?

101次滚动验证:Chronos-2如何证明自己

为了回答这个问题,迪卡侬设计了一次严苛的大规模基准测试,这次测试的规模和严谨程度在零售行业中罕见。

测试设计包括以下核心要素:101次滚动截止验证,覆盖将近两年时间(2022年第48周到2024年第44周);每次截止验证约处理2.5万个唯一产品,整个评估期共涉及约3.9万个独特产品时序;同时验证12周和52周两个时间窗口;主要评估指标为加权绝对百分比误差(WAPE),辅以均方根误差、偏差和两两胜率等指标。

这个测试设计的关键在于”滚动验证”:不是用一个时间点的历史数据训练然后在未来一个时间点测试,而是在整个2年时间窗口内进行101次独立的训练-测试循环,每次使用不同的截止时间。这种方法能够评估模型在不同季节、不同时间点的稳定性,而不只是在某一个特定条件下的表现。这是一种更接近真实生产环境的评估方式:生产中的预测系统不会只在理想条件下运行。

测试结果明确支持了Chronos-2。在包括12周和52周在内的多个评估维度上,Chronos-2展现出优于迪卡侬原有生产基准的预测精度。更重要的是,Chronos-2在不同季节、不同产品类别和不同地区的表现都保持了良好的稳定性——这对于一个需要覆盖极高多样性产品组合和多地区部署的系统来说,稳定性比单点高峰表现更有价值。

在冷启动问题上,Chronos-2展现了传统模型所缺乏的能力。对于没有历史数据的新产品,Chronos-2可以利用其在大量时序数据上预训练获得的通用模式识别能力,基于产品类别特征和相似产品的历史数据生成合理的初始预测。这虽然不完美,但比传统方法”无历史数据=无法预测”的硬约束有了实质性的改善。

从评估到生产:规模化部署的架构选择

证明Chronos-2有效只是第一步,在生产环境中大规模运行它是另一个完全不同的工程挑战。

迪卡侬选择将Chronos-2部署在亚马逊SageMaker上,利用SageMaker的批量推理能力处理每周数万个产品时序的并行预测任务。官方博客在精度提升的具体量化数字上给出了部分对比,但完整的性能数据(如处理时间和与旧系统的直接量化对比)属于商业敏感信息,未在博客中完全披露。这个架构选择有几个明确的考量:SageMaker提供了经过验证的大规模机器学习工作负载运行环境,内置了弹性扩展能力;SageMaker与AWS其他数据服务的深度集成降低了数据管道的复杂性;亚马逊官方支持Chronos-2在SageMaker上的优化部署,意味着有官方技术支持和持续的性能优化。

相比之前的DeepAR每周重新训练,Chronos-2的一个重要运维优势是不需要频繁重训。作为一个预训练基础模型,Chronos-2不依赖特定的训练循环来保持当前性能——它可以在推理时直接消化最新数据,生成预测结果。这显著降低了系统的运维开销:过去需要大量工程资源管理训练任务的时间和资源,现在可以更多地投入到业务影响分析和模型优化上。

扩展新区域的工程成本也大幅降低。传统方法中,在新地区部署预测系统需要为该地区的数据特征设计定制的模型架构或训练流程,通常需要数个月的工程工作。使用Chronos-2,新区域的初始部署可以直接利用现有的模型和推理基础设施,只需要将该地区的历史数据接入数据管道即可。迪卡侬正在将这套系统扩展到中东和非洲地区,这种低成本的地区扩展能力对于其全球化战略至关重要。

这个案例告诉我们什么

迪卡侬的Chronos-2实践,是零售AI从概念验证走向规模化生产的一个标志性案例,它的价值不只在于技术选型,更在于整个落地过程揭示的深层规律。

第一个规律:严苛的领域专属验证是不可跳过的步骤。 时序基础模型的通用能力不能直接等同于在特定领域数据上的有效性。迪卡侬的101次滚动验证,是一个清醒地用自己的真实数据检验通用技术主张的范例。在选择基础模型时,”在标准基准上排名第一”不等于”在你的数据上有效”,必须用自己的真实数据验证。

第二个规律:运维复杂性是企业AI落地的隐形成本,往往被严重低估。 迪卡侬从DeepAR迁移到Chronos-2的一个重要驱动力,是降低每周重新训练的运维开销。在生产环境中,一个技术上”更好”但运维成本更高的方案,实际总成本可能高于一个技术上”次好”但运维简单的方案。基础模型的低运维特性——不需要频繁重训——是其在生产场景中的一个容易被忽视的竞争优势。

第三个规律:冷启动能力是新市场和新产品持续扩张的关键基础设施。 对于迪卡侬这样持续在新地区扩张并持续推出新产品的公司,需求预测系统处理冷启动的能力不是一个边缘场景,而是核心运营能力。传统方法无法有效处理冷启动,实际上是在限制公司的扩张速度。基础模型改善冷启动问题,从根本上解除了这个约束。

第四个规律:基础模型正在把专业化的技术能力向更广泛的企业群体普及。 迪卡侬能够组建一个内部团队自主完成这套系统的评估和部署(迪卡侬有专业的数据科学和技术团队),说明Chronos-2和SageMaker这套工具组合的可用性已经达到了一个门槛:具备足够数据科学能力的企业内部团队可以独立掌握,不需要完全依赖外部顾问。这不等于说任何规模的企业都可以立刻上手——基础数据科学能力和数据治理仍然是前提条件——但门槛确实在降低。

零售业的预测问题存在了几百年,但解法的技术含量每个时代都在提升。迪卡侬的Chronos-2实践,是这个时代最清晰的一个路标:人工智能供应链智能化,正在从理念变成可复制的生产级实践。


参考资料

  1. Vianney Bruned, Abdul Fatir Ansari等:How Decathlon runs demand forecasting at scale with Chronos-2, AWS机器学习官方博客, 2026-08-28. https://aws.amazon.com/blogs/machine-learning/how-decathlon-runs-demand-forecasting-at-scale-with-chronos-2/
  2. Introducing Chronos-2: from univariate to universal forecasting, Amazon Science官方博客. https://www.amazon.science/blog/introducing-chronos-2-from-univariate-to-universal-forecasting

时序基础模型革命:从Chronos到Chronos-2的技术跨越

要深入理解Chronos-2为什么能在迪卡侬的场景中胜出,需要了解时序基础模型这个技术概念的来龙去脉。

传统的时序预测方法,无论是统计方法(ARIMA、Holt-Winters、STL分解)还是机器学习方法(XGBoost、LightGBM等),都有一个共同的根本性限制:每个模型都需要在特定的数据集上训练,模型的有效性与训练数据的质量和数量高度绑定。这意味着对于新产品或新市场,传统方法面临先天的冷启动困境;对于数据稀疏的产品(比如高价低频商品),传统方法的预测可靠性大幅下降;对于每个新场景,都需要重新设计特征工程和训练流程,工程成本线性增长。

深度学习的引入缓解了部分问题。DeepAR等循环神经网络模型可以通过跨产品联合训练,让数量丰富的产品帮助提升数量稀少产品的预测精度。但本质上,这类方法仍然依赖领域内的训练数据,迁移到全新领域仍然困难。

时序基础模型代表了一种范式转变,其核心理念来自于自然语言处理领域大型语言模型的成功经验:如果一个模型在海量多样化数据上进行预训练,它能否学会一种通用的时序推理能力,而不只是某个特定领域的时序规律?

亚马逊科学的研究团队在Chronos的工作中给出了肯定的答案。Chronos通过将时序数据转化为语言模型能够处理的token序列,利用大型语言模型架构在大量公开时序数据集上进行预训练。这个过程让模型内化了时序数据的通用模式:趋势、季节性、突变点、噪声结构等。

Chronos-2则在此基础上进一步突破:它扩展了Chronos的单变量预测能力,迈向真正的通用预测。Chronos-2不只是能预测一个时序,而是能够同时处理多个相关时序,理解它们之间的相互关系。在零售场景中,这意味着模型可以同时考虑不同产品在同一供应区域的需求相关性,可以理解同一产品在不同地区的需求协同变化,可以将天气、节假日等协变量作为条件信息纳入预测。这是从”单变量预测器”到”理解上下文的预测引擎”的本质升级。

迪卡侬的评估数据证实了这种理论优势在实践中的有效性。关键在于:他们没有只在标准测试数据集上验证,而是在自己真实的业务数据上进行了严格验证。这个做法本身就值得所有考虑采用基础模型的企业学习——任何基础模型在通用基准上的表现,都不能替代在你自己业务数据上的实际验证。

从迪卡侬到更大的图景:供应链AI的下一个十年

迪卡侬的案例不是孤立的。它是一个更大趋势的先行指标:时序基础模型正在重构制造和零售行业的供应链智能化路径。

过去五年,供应链AI的发展呈现出一个有趣的模式:技术上越来越强大,但实际大规模落地的比例始终偏低。原因是多方面的:专业数据科学人才稀缺,项目启动成本高;每个企业的数据特征不同,通用方案难以直接适用;维护和更新模型需要持续的工程资源投入;冷启动问题导致新业务场景无法快速纳入预测体系。

时序基础模型的出现,有潜力系统性地降低上述障碍。预训练模型降低了冷启动门槛;通用架构减少了为每个场景定制工程的需要;云服务平台的托管部署降低了运维复杂性。这些变化加在一起,可能会把供应链AI从”只有顶级企业才有能力大规模实施”的奢侈品,逐渐变成中等规模企业也可以负担的标准工具。

迪卡侬的案例还有一个特别值得关注的细节:这套系统的落地是由迪卡侬内部团队与亚马逊团队联合完成的,而不是依赖一个外部咨询团队来”交钥匙”解决方案。联合撰写的技术博客显示,迪卡侬的数据科学团队深度参与了模型评估、架构设计和生产部署的全过程。这意味着他们不只是”使用”了Chronos-2,而是真正理解并掌握了这套系统。这种技术能力的内化,是确保长期运营质量的关键,也是企业AI落地成功的核心条件之一。

对于正在考虑供应链AI投资的企业而言,迪卡侬的经验提供了几个具体的行动建议:首先,不要跳过严格的领域内验证,通用基准不能替代真实业务数据的检验;其次,把运维成本纳入技术方案选型的核心考量,一个难以维护的方案即使初期效果好也可能长期失败;第三,冷启动能力应该作为评估时序预测方案的必考项,而不是可选的加分项;最后,考虑将内部团队的技术能力建设作为项目目标之一,不只是追求即时的预测精度提升。

从滑雪手套到冲浪板,从欧洲到东南亚,迪卡侬每周需要对数万个产品的需求做出正确预测,这套系统现在靠Chronos-2来支撑。当这个方案被写成技术博客分享给全世界时,它的价值已经超越了迪卡侬自身——它成为了一张全球零售业供应链AI现实可行性的最有力证明书。

零售业的下一个十年,最大的竞争优势或许不是谁的品牌更响亮,而是谁能更准确地在3个月前知道,顾客下周会想买什么。