스트림 처리 플랫폼에서 잘못된 데이터를 처리하기 위한 ... 노트

스트림 처리 플랫폼에서 잘못된 데이터를 처리하기 위한 모범 사례

오늘날 스트림 처리 플랫폼은 사물 인터넷(IOT) 장치, 금융 거래, 은행의 웹 애플리케이션 및 서버, 제조 장비, 창고 및 선박의 물류 시스템, 웹 포털의 대화형 에이전트와의 고객 활동에서 지속적으로 흐르는 데이터의 실시간 분석을 용이하게 합니다. Apache Kafka, Apache Flink, Apache Spark Structured Streaming과 같은 스트리밍 프레임워크와 스트림 데이터베이스는 비즈니스 담당자가 실시간으로 수백만 개의 이벤트를 처리할 수 있도록 지원합니다.하지만 스트리밍 플랫폼의 가치는 입력되는 데이터의 품질에 전적으로 달려 있습니다. 잘못된 형식의 이벤트, 중복 메시지, 누락된 필드 또는 잘못된 타임스탬프는 부정확한 분석 생성, 잘못된 경고 트리거, 경고 폭주, 심지어 애플리케이션 충돌로 이어질 수 있습니다. 배치 처리는 실행 전에 데이터를 정리할 수 있지만, 스트림 처리는 데이터가 흐르는 동안 유효성 검사 및 수정이 이루어져야 합니다. 따라서 강력한 데이터 품질 전략을 수립하는 것은 모든 이벤트 기반 아키텍처의 핵심적인 필요 조건입니다.