如何使用 Google Cloud 的 Lakehouse ... 笔记

如何使用 Google Cloud 的 Lakehouse 运行时目录现代化 Apache Hive

多年来,Apache Hive Metastore(HMS)一直是大数据分析的核心权威,负责管理 Spark 和 Presto 等查询引擎的 schema。然而,随着数据架构的扩展并跨越多个查询引擎,传统的 HMS 部署已成为显著的操作瓶颈。这些遗留系统难以应对架构扩展问题,因其依赖关系型数据库而引发性能问题。此外,它们导致身份与安全治理形成孤岛,需要在不同的控制平面实施碎片化的策略。同时,管理和调优独立的 HMS 实例会带来可观的操作负担,并增加总体拥有成本。Google Cloud 的无服务器 Lakehouse 运行时目录提供了一种解决方案,该方案基于开放的 Apache Iceberg REST Catalog 规范构建。此目录是一个统一、高可用的元数据注册表,既支持传统的 Hive/Parquet 格式,也支持 Iceberg 等现代格式。它将元数据发现与计算引擎解耦,允许多个引擎在不复制数据的情况下访问数据。这实现了多引擎互操作性、开放 API,并通过直接引用云存储中现有数据实现零数据复制迁移。AI 驱动的治理与 Cloud IAM 集成,提供一致的安全性和可信上下文,而凭据分发则进一步增强了安全性。Lakehouse 运行时目录已具备企业就绪能力,依托 Google 的基础设施进行扩展,并提供高可用性以支持故障转移。其无服务器特性减少了操作负担和总体拥有成本。零复制迁移能力允许直接从传统 Hive Metastore 迁移至 Lakehouse 目录。向 Lakehouse 现代化转型统一了治理,为代理提供可信上下文,并大幅降低操作成本,为云环境中的代理级操作做好准备。
CdXz5zHNQW_H3FQKMqnb7.png