Présentation de la couche d’ab... Note

Présentation de la couche d’abstraction des données Netflix TimeSeries

Netflix a développé l'abstraction TimeSeries pour stocker et interroger efficacement de grands volumes de données d'événements temporels avec des latences de quelques millisecondes. Ce système est conçu pour gérer des écritures à haute fréquence, des requêtes efficaces dans de grands ensembles de données, des lectures et des écritures mondiales, une configuration adaptable et une efficacité coût. L'abstraction TimeSeries est basée sur des principes de conception clés, y compris la partition des données, le stockage flexible, la configurabilité, la scalabilité et l'infrastructure en fragments.Le modèle de données se compose d'éléments d'événement, d'événements, d'identifiants de série temporelle et d'espace de noms. Les éléments d'événement sont des paires clé-valeur qui stockent des données pour un événement donné, tandis que les événements sont des collections structurées d'un ou plusieurs éléments d'événement. Les identifiants de série temporelle sont des collections d'événements sur la période de rétention d'un ensemble de données, tandis que les espaces de noms sont des collections d'identifiants de série temporelle et de données d'événement.L'abstraction TimeSeries fournit des API pour interagir avec les données d'événement, y compris WriteEventRecordsSync, WriteEventRecords, ReadEventRecords, SearchEventRecords et AggregateEventRecords. La couche de stockage se compose d'un magasin de données principal et d'un magasin d'index optionnel, Apache Cassandra et Elasticsearch étant les choix préférés pour stocker des données durables et indexer, respectivement.Le magasin de données principal utilise un schéma de partitionnement temporel pour diviser les données en morceaux gérables en fonction des intervalles de temps, ce qui permet des requêtes efficaces pour des plages de temps spécifiques et optimise les performances de stockage et de requête. Les données sont ensuite partitionnées en seaux de temps et en seaux d'événement pour faciliter les scans de plage efficaces et gérer les opérations d'écriture à haute fréquence.L'abstraction TimeSeries est conçue pour répondre aux défis de stockage et d'interrogation des données d'événements temporels à grande échelle, y compris la haute fréquence, les requêtes efficaces, les lectures et les écritures mondiales, la configuration adaptable et l'efficacité coût. En utilisant un modèle de données d'événement unique et une couche de stockage scalable, l'abstraction TimeSeries offre une solution versatile et rentable pour gérer les données temporelles à Netflix.