데이터 레이크 소개 2부
AWS의 서버리스 데이터 레이크는 스토리지, 처리, 카탈로그, 보안, 활용이라는 다섯 가지 기본 기둥 위에 구축됩니다. Amazon S3는 원시 데이터와 처리된 데이터를 모두 구조화된 폴더 계층 구조로 저장하는 핵심 스토리지 역할을 합니다. 주요 S3 구성에는 버전 관리, 비용 최적화를 위한 수명 주기 정책, 암호화, 교차 리전 복제가 포함됩니다. AWS Glue는 ETL을 위한 Glue Jobs, 중앙 집중식 메타스토어로서의 Glue Catalog, 스키마 검색을 위한 Glue Crawlers를 제공하는 처리 엔진입니다.Amazon Athena는 S3 데이터에 직접 표준 SQL을 사용하여 서버리스 쿼리 서비스를 제공하며, 쿼리당 지불 방식의 가격 책정과 Glue Catalog와의 네이티브 통합을 특징으로 합니다. AWS Lambda는 S3 파일 업로드와 같은 이벤트에 의해 트리거되어 프로세스를 시작하는 오케스트레이터 역할을 합니다. AWS CDK는 이 인프라를 코드로 정의하는 데 사용되어 재현성과 버전 관리를 보장합니다.일반적인 데이터 흐름은 S3 raw로의 데이터 수집, S3 알림을 통한 Lambda 트리거, Glue Crawlers에 의한 카탈로깅, Glue Jobs에 의한 처리, S3 processed에 저장, Athena를 통한 분석을 포함합니다. 비용 최적화 전략에는 Parquet 형식 사용, 압축, 지능형 파티셔닝, S3 Intelligent Tiering, 수명 주기 정책이 포함됩니다. 보안은 IAM 역할, 정책, S3, Glue, Athena 전반에 걸친 엔드투엔드 암호화를 통해 관리됩니다. 다음 게시물에서는 작업 최적화, 테스트, CI/CD 통합을 다루는 실제 AWS Glue 구현에 대해 중점적으로 다룰 것입니다.