프로젝트 라이트하우스 — 3부: project-ligh... 노트

프로젝트 라이트하우스 — 3부: project-lighthouse-anonymize 소개

"Project Lighthouse는 2020년 Airbnb가 시민권 및 개인정보 보호 단체와 협력하여 출시했으며, 개별 계정과 절대 연결되지 않는 인종 인식 데이터를 기반으로 사용자 경험의 잠재적 불일치를 측정하고 완화하는 것을 목표로 합니다. 이 데이터는 불일치 측정에만 사용되며 사용자는 옵트아웃할 수 있습니다. Airbnb는 프로젝트의 개인정보 보호 익명화 코드를 지원하는 Python 라이브러리인 "project-lighthouse-anonymize"를 오픈 소스로 공개했습니다. 코드 출시와 함께 2020년 원본 논문을 보완하는 두 개의 새로운 기술 논문이 발표되었습니다. 2020년 논문은 민감한 속성 공개를 방지하기 위해 k-익명성을 선택한 개인정보 보호 설계 접근 방식을 확립했습니다. 첫 번째 새 논문인 "Core Mondrian: Basic Mondrian beyond k-anonymity"는 확장 가능한 아키텍처, 병렬 처리 및 대규모 데이터셋을 위한 기타 개선 사항으로 클래식 Mondrian 알고리즘을 확장하는 확장 가능한 k-익명성 알고리즘을 자세히 설명합니다. 두 번째 새 논문인 "Measuring Data Quality for Project Lighthouse"는 Pearson 상관관계, Revised Information Loss Metric (RILM), Normalized Mutual Information v1 (NMIv1)의 세 가지 주요 지표를 포함하여 익명화된 데이터의 품질을 평가하기 위한 포괄적인 프레임워크를 소개합니다. 이 프레임워크는 경험적 검증 방법론을 사용하며, 익명화된 데이터가 통계적으로 유효한 결과를 생성하는 시기를 예측하기 위해 데이터 품질 평가를 머신러닝 분류 문제로 재구성합니다. 이 라이브러리는 이러한 지표에 대한 기본 임계값을 제공합니다. 이 라이브러리는 PyPI 및 GitHub에서 사용할 수 있으며, 사용자는 교란을 통해 k-익명성 및 p-민감 k-익명성을 모두 강제할 수 있으며, UCI Adult 데이터셋을 사용한 완전한 예제가 제공됩니다. Airbnb는 신뢰를 구축하고 다른 회사들의 유사한 이니셔티브를 장려하기 위해 방법론의 투명성을 강조합니다."
CdXz5zHNQW_Ex4eRTWVVf.png