数据湖入门 第二部分
基于 AWS 的无服务器数据湖建立在五大核心支柱之上:存储、处理、目录、安全和利用。Amazon S3 作为核心存储层,以结构化的文件夹层级存放原始数据和处理后的数据。关键的 S3 配置包括版本控制、用于成本优化的生命周期策略、加密以及跨区域复制。AWS Glue 是处理引擎,提供用于 ETL 的 Glue Jobs、作为集中式元数据存储的 Glue Catalog,以及用于模式发现的 Glue Crawlers。Amazon Athena 提供无服务器查询服务,可直接在 S3 数据上使用标准 SQL 进行查询,采用按查询付费的定价模式,并原生集成 Glue Catalog。AWS Lambda 作为编排器,由 S3 文件上传等事件触发以启动流程。AWS CDK 用于以代码形式定义该基础设施,确保可重复性和版本控制。典型的数据流包括:数据摄入至 S3 原始层,通过 S3 通知触发 Lambda,由 Glue Crawlers 进行目录注册,由 Glue Jobs 执行处理,存储至 S3 处理层,并通过 Athena 进行分析。成本优化策略包括使用 Parquet 格式、压缩、智能分区、S3 Intelligent Tiering 以及生命周期策略。安全通过 IAM 角色、策略以及覆盖 S3、Glue 和 Athena 的端到端加密进行管理。下一篇文章将聚焦于实用的 AWS Glue 实施,涵盖作业优化、测试以及 CI/CD 集成。