2026年8月21日,AWS宣布Glue 6.0正式GA,核心亮点之一:价格下调30%

这个数字不应该被轻描淡写地放在发布公告的第一段然后让人跳过。AWS Glue是全球数据工程工作负载中占有率最高的托管ETL服务之一,承载着无数企业的数据管道运营。降价30%,在任何行业都是一个重大信号。

与此同时,Glue 6.0带来了技术栈的全面升级:

  • Apache Iceberg v3完整支持(VARIANT数据类型自动shredding、删除向量、空间数据类型geometry/geography、更灵活的schema演进)
  • Apache Spark 4.1 / Python 3.13 / Scala 2.13运行时升级
  • Spark Declarative Pipelines:消除重复的编排样板代码
  • Real-Time Mode:亚秒级流处理延迟
  • Arrow-native Python UDFs:显著改善PySpark性能

降价+技术升级同步发布——这是AWS典型的”拿下市场再建护城河”组合拳。


第一层:30%降价的战略意义

AWS Glue的定价模式以DPU(Data Processing Unit)计费。降价30%,直接影响数据工程团队的月度账单。

但这不是因为AWS计算成本降低了30%。这是竞争驱动的主动降价:

  • Databricks在开源生态的号召力越来越强——Spark的原创者,背靠Delta Lake,有强大的开发者社区
  • Microsoft Fabric把Power BI、Data Factory、Synapse整合成统一数据平台,用微软企业生态留住客户
  • Snowflake逐步扩展ETL能力,蚕食Glue的份额

AWS降价30%的逻辑:用价格优势加速工作负载迁移到AWS Glue,在竞争对手的ETL优势到来之前,先把量做起来,把习惯建立起来。

而Iceberg v3的完整支持,是另一个战略信号:AWS在押注Iceberg成为数据湖的统一标准格式,而不是Delta Lake。 谁赢得格式战争,谁就赢得了数据工程生态里最关键的”选择权”。


第二层:Iceberg v3的技术意义

Iceberg v3的新特性,每一个都指向一类具体的工程痛点:

VARIANT数据类型(with automatic shredding):半结构化数据(JSON、事件日志)的性能痛点。自动shredding意味着可以在保持JSON灵活性的同时,获得接近列式存储的查询性能。

删除向量(Deletion Vectors):解决GDPR/CCPA合规中的”被遗忘权”问题。以前删除记录需要重写整个Parquet文件,现在可以用逻辑删除向量高效标记,后台异步清理。这是数据合规场景的颠覆性改变。

空间数据类型(geometry/geography):地理信息数据正式成为Iceberg原生公民。零售选址分析、物流路径优化、城市规划数据处理,可以直接在数据湖里跑,不需要再导出到PostGIS或专用GIS系统。

Spark Declarative Pipelines:类似dbt的声明式逻辑——你只需要描述你想要什么数据,不需要写如何移动数据的管道代码。这是对”数据工程=写ETL胶水代码”这一传统认知的正面冲击。


第三层:数据工程商品化与职业转型的预警

降价30%,加上Agent化数据工程(AWS ADOP的方向),加上声明式管道消除样板代码——这三件事加在一起,指向同一个方向:

数据工程里最无聊但最耗时的那部分工作,正在加速被商品化和自动化。

写Spark ETL代码来移动数据?商品化。配置数据管道?声明式Pipeline接管。管理数据格式兼容性?Iceberg v3统一。

但这对数据工程师来说是一次升级邀请:

真正稀缺的能力正在从”会写ETL代码”转向”理解数据架构决策”:

  • 什么时候用Iceberg v3的VARIANT类型,什么时候用传统列式存储?
  • 如何设计在Glue、Databricks、Snowflake之间灵活迁移的湖仓架构,避免厂商锁定?
  • 如何评估声明式Pipeline的局限性,知道什么情况下需要回到命令式代码?

AWS把ETL的执行层降价30%,同时把架构决策的复杂性留给了数据工程师。当基础设施被商品化,工程师的价值就集中到了判断力。

AWS Glue 6.0是这个趋势的最新数据点,不是最后一个。


来源:AWS官方公告 (2026-08-21)、AWS Glue定价页面、Apache Iceberg v3规范