Лучшие практики обработки неко... Заметка
DZone.com Feed на русском

Лучшие практики обработки некорректных данных на платформах потоковой обработки

Сегодня платформы потоковой обработки данных облегчают анализ в реальном времени данных, непрерывно поступающих от устройств Интернета вещей (IoT), финансовых транзакций, веб-приложений и серверов в банках, производственного оборудования, логистических систем на складах и судах, а также действий клиентов с помощью диалоговых агентов на веб-порталах. Фреймворки потоковой обработки, такие как Apache Kafka, Apache Flink, Apache Spark Structured Streaming и потоковые базы данных, позволяют специалистам обрабатывать миллионы событий в реальном времени.Но ценность вашей платформы потоковой обработки полностью зависит от качества данных, поступающих в нее. Неправильно сформированное событие, дублирующееся сообщение, отсутствующее поле или недействительная временная метка могут привести к некорректной генерации аналитики, ложным срабатываниям оповещений, всплескам оповещений и даже сбоям приложений. Пакетная обработка позволяет очищать данные перед выполнением, но потоковая обработка требует, чтобы проверка и исправления происходили во время потока данных. Таким образом, разработка надежной стратегии качества данных является основной необходимостью любой событийно-ориентированной архитектуры.