加速无边界数据湖:宣布跨云缓存预览版
无边界 Lakehouse 实现了对跨多个云的组织完整数据资产的统一访问。此前,整合分布式数据需要复杂的 ETL 管道和昂贵的数据传输。Lakehouse 通过联接到各种云目录实现就地查询数据,并借助合作伙伴跨云互连(Partner Cross-Cloud Interconnect)降低传输成本。新增功能进一步优化跨云查询成本,通过最小化数据传输实现。Lakehouse 的跨云缓存透明地加速查询并削减远程传输成本,通过本地缓存频繁访问的数据实现。该缓存以子文件块粒度运行,对静态数据进行加密,并维持租户和区域隔离。新鲜度检查通过在服务缓存结果前验证远程数据是否发生变化来确保数据准确性。在实践中,这种缓存显著减少了数据传输量,通常降至处理数据的 5% 以下。这种效率降低了总拥有成本(Total Cost of Ownership),使跨云分析和 AI 在企业规模上具备可行性。结合 Iceberg 的压缩功能,可将网络传输降至处理总数据的 3% 以下。BigQuery 跨云连接也已进入预览阶段,允许直接查询其他云中的非 Iceberg 数据并加速工作负载。这些连接利用 Google Cloud 区域中的 BigQuery 计算工作节点,提供全球可用性和完整的 BigQuery 功能对等性。