공공 및 민간 데이터 통합: Spanner의 Data Commons를 활용한 지식 그래프 확장
Data Commons 프로젝트는 100개 이상의 권위 있는 제공업체의 파편화된 공개 데이터셋을 통합하여 전 세계 정보를 정리하고 보편적으로 접근 가능하며 유용하게 만드는 것을 목표로 합니다. Data Commons는 표준화된 Schema.org 정의를 사용하여 구조화된 4,000억 개 이상의 데이터 포인트를 통해 실제 사물과 그 관계를 연결하는 지식 그래프를 제공합니다. 이 플랫폼은 데이터 탐색 도구, MCP 도구 및 클라우드 기반 API를 제공하여 정리된 데이터셋에 액세스하고 통합할 수 있도록 하여 기업이 내부 데이터를 공개 참조 데이터와 더 쉽게 연결할 수 있도록 합니다. Data Commons는 농업, 인구 통계, 경제, 환경 및 건강을 포함한 여러 도메인에 걸쳐 공개 정보를 통합하여 국가 GDP 추세 분석 및 지역 건강 형평성 추적과 같은 강력한 사용 사례를 발굴합니다. 이 플랫폼은 Spanner Graph를 통해 네이티브 그래프 모델로 전환되었으며, 이는 고가용성, 수평적 확장 및 네이티브 ISO/IEC 39075 Graph Query Language 지원을 갖춘 Spanner에 SQL과 유사한 인터페이스와 그래프 표현의 편리성을 제공합니다. 다중 엔티티 Spanner Graph 스키마를 채택함으로써 Data Commons는 엔티티를 노드로, 도메인 링크를 동적 그래프 엣지로 표현하여 GQL을 사용하여 데이터베이스 내에서 직접 복잡한 관계 쿼리를 수행할 수 있습니다. 새로운 아키텍처는 복잡한 사전 계산된 인덱스의 필요성을 제거하여 파이프라인을 단순화하고 전체 데이터베이스를 새로 고치지 않고도 특정 데이터셋의 증분 업데이트를 가능하게 합니다. Data Commons는 또한 통계 데이터 및 메타데이터 교환 기술 표준의 간결한 구현을 채택하여 통계 데이터와 설명적인 통계 메타 정보를 함께 설명하고 교환하는 일관된 접근 방식을 제공합니다. Data Commons 플랫폼 업데이트는 SDMX 기술 표준 버전 3.0에 대한 지원을 추가하여 다차원 데이터셋을 위한 타사 도구와의 즉시 사용 가능한 통합을 제공합니다. 공개 지식 그래프와 자체 데이터를 포함하는 개인 지식 그래프를 통해 연합함으로써 사용자는 데이터 격리를 유지하고 데이터 중복이 없도록 보장하면서 흥미로운 새로운 사용 사례를 발굴할 수 있습니다.