Google Cloud の Lakehouse ランタイムカタログを使用して Apache Hive を最新化する方法
10年以上にわたり、Apache Hive Metastore (HMS) は、SparkやPrestoなどのクエリエンジンのスキーマを管理する、ビッグデータ分析の中央管理機関でした。しかし、データアーキテクチャがスケールアップし、複数のクエリエンジンにまたがるようになると、従来のHMSデプロイメントは重大な運用上のボトルネックとなります。これらの従来のシステムは、リレーショナルデータベースへの依存がパフォーマンスの問題を引き起こすため、アーキテクチャのスケーリングの問題に苦労しています。また、サイロ化されたIDおよびセキュリティガバナンスを作成し、異なるコントロールプレーン全体で断片化されたポリシーが必要となります。さらに、スタンドアロンのHMSインスタンスの管理とチューニングは、かなりの運用オーバーヘッドと総所有コストの増加につながります。Google CloudのサーバーレスLakehouseランタイムカタログは、オープンなApache Iceberg REST Catalog仕様に基づいて構築されたソリューションを提供します。このカタログは、従来のHive/ParquetとIcebergのような最新のフォーマットの両方をサポートする、統一された高可用性のメタデータレジストリです。これは、メタデータ検出をコンピューティングエンジンから分離し、複数のエンジンがデータをコピーせずにアクセスできるようにします。これにより、マルチエンジン相互運用性、オープンAPI、およびクラウドストレージ内の既存のデータを直接参照することによるゼロデータコピー移行が可能になります。AI搭載のガバナンスはCloud IAMと統合され、一貫したセキュリティと信頼できるコンテキストを提供し、クレデンシャルベンディングはセキュリティをさらに強化します。Lakehouseランタイムカタログはエンタープライズレディであり、Googleのインフラストラクチャ上でスケールし、フェイルオーバーのための高可用性を提供します。そのサーバーレスな性質は、運用上の労力と総所有コストを削減します。ゼロコピー移行機能により、従来のHive MetastoresからLakehouseカタログへの直接移行が可能になります。Lakehouseへのモダナイゼーションは、ガバナンスを統合し、エージェントに信頼できるコンテキストを提供し、運用コストを削減して、エージェントスケールの運用に対応できるようにクラウド環境を準備します。