统一公共与私有数据:在 Spanner 上利用 Data C... 笔记

统一公共与私有数据:在 Spanner 上利用 Data Commons 扩展知识图谱

Data Commons 项目旨在组织全球信息,使其普遍可获取且有用,通过整合来自 100 多个权威提供方的碎片化公共数据集来实现这一目标。Data Commons 提供了一个知识图谱,连接现实世界实体及其关系,包含超过 4000 亿个数据点,并使用标准化的 Schema.org 定义进行结构化。该平台提供数据探索工具、MCP 工具以及基于云的 API,用于访问和集成清洗后的数据集,使企业能够更便捷地将内部数据与公共参考数据相连接。Data Commons 跨多个领域整合公共信息,包括农业、人口统计、经济、环境和健康,从而解锁强大的应用场景,例如分析国家 GDP 趋势和追踪地方健康公平性。该平台已过渡到原生图模型 Spanner Graph,将类似 SQL 的界面便利性和图表达能力引入 Spanner,同时保留其高可用性、水平扩展能力以及对原生 ISO/IEC 39075 图查询语言(GQL)的支持。通过采用多实体 Spanner Graph 模式,Data Commons 将实体表示为节点,将其领域链接表示为动态图边,允许直接在数据库中使用 GQL 执行复杂的关系查询。新架构通过消除对复杂预计算索引的需求简化了数据管道,并支持对特定数据集进行增量更新,而无需刷新整个数据库。Data Commons 还采用了精简版的统计数据和元数据交换(SDMX)技术标准,为描述和交换统计数据及其描述性统计元信息提供一致的方法。Data Commons 平台更新增加了对 SDMX 技术标准的 3.0 版本支持,提供开箱即用的第三方工具集成,以处理多维数据集。通过联合公共知识图谱和包含用户自身数据的私有知识图谱,用户可以在保持数据隔离并确保无数据重复的同时,激发令人兴奋的新应用场景。
CdXz5zHNQW_8FZTNms1zk.png