パブリックデータとプライベートデータの統合:Spanner上... ノート

パブリックデータとプライベートデータの統合:Spanner上のData Commonsによるナレッジグラフのスケーリング

Data Commons プロジェクトは、世界中の情報を整理し、100を超える権威あるプロバイダーからの断片化された公開データセットを統合することで、普遍的にアクセス可能で有用なものにすることを目指しています。Data Commons は、実世界の事柄とその関係性を結びつけるナレッジグラフを提供し、標準化された Schema.org の定義を使用して構造化された4000億以上のデータポイントを備えています。このプラットフォームは、データ探索ツール、MCPツール、およびクラウドベースのAPIを提供して、クリーンなデータセットにアクセスおよび統合できるようにし、企業が内部データを公開参照データと容易に接続できるようにします。Data Commons は、農業、人口統計、経済、環境、健康を含む複数のドメインにわたる公開情報を統合し、国のGDPトレンドの分析や地域的な健康の公平性の追跡などの強力なユースケースを解き放ちます。プラットフォームは、Spanner Graph を使用したネイティブグラフモデルに移行しました。これにより、Spanner の高可用性、水平スケーラビリティ、およびネイティブ ISO/IEC 39075 Graph Query Language サポートに、SQLライクなインターフェースとグラフの表現力を組み合わせて提供します。マルチエンティティ Spanner Graph スキーマを採用することで、Data Commons はエンティティをノードとして、そのドメインリンクを動的なグラフエッジとして表現し、GQL を使用してデータベース内で直接複雑な関係クエリを実行できるようにします。新しいアーキテクチャは、複雑な事前計算されたインデックスの必要性を排除することでパイプラインを簡素化し、データベース全体をリフレッシュすることなく特定のデータセットの増分更新を可能にします。Data Commons は、Statistical Data and Metadata eXchange 技術標準の軽量実装も採用しており、統計データとその記述的な統計メタ情報を一貫した方法で記述および交換するためのアプローチを提供します。Data Commons Platform のアップデートは、SDMX 技術標準バージョン 3.0 のサポートを追加し、多次元データセット向けのサードパーティツールとのすぐに使える統合を提供します。公開ナレッジグラフと独自のデータを含むプライベートナレッジグラフ全体でフェデレーションすることにより、ユーザーはデータの分離を維持し、データの重複がないことを保証しながら、エキサイティングな新しいユースケースを有効にすることができます。
CdXz5zHNQW_8FZTNms1zk.png