Riverbed Data Hydration — Part... ノート

Riverbed Data Hydration — Part 1

Riverbedは、Airbnbのテックスタックの一部で、レコードストアから読み込み最適化されたストアを更新するデータ消費を最適化します。ラムダーアーキテクチャーを使用し、ストリーミングコンポーネントとバッチコンポーネントがあります。ストリーミングアスペクトは、チェンジデータキャプチャー(CDC)イベントからマテリアライズドビューを構築することに焦点を当てています。Notification Pipelineは、通知イベントを消費し、依存するデータソースを照会してマテリアライズドビューを構築し、シンクストアに書き込みます。Join操作は、DAGのような構造を使用してデータソースを効率的に結合し、JoinConditionsDagをメタデータに、JoinResultsDagを結果の保存に使用します。Stitch操作は、結合された結果を使用可能なモデル、StitchModelに変換します。Riverbedは、Apache HiveやKafkaを含む複数のシンクをサポートし、柔軟性を提供します。ストリーミングシステムは、CDCイベントからマテリアライズドビューを効率的に更新し、スケーラビリティ、効率的なデータフェッチ、フィルタリングと検索機能の向上を可能にしています。次のブログポストで話題にするSource Pipelineは、並行処理とバージョニングにおいて重要な役割を果たします。DAGベースのデータ構造を活用することで、Riverbedはストリーミングデータの結合を最適化し、メモリーの使用量を削減し、効率を向上させています。