Skip to main content
QUICK REVIEW

[논문 리뷰] PrivLava: Synthesizing Relational Data with Foreign Keys under Differential Privacy

Kuntai Cai, Xiaokui Xiao|arXiv (Cornell University)|2023. 04. 10.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

PrivLava는 외래 키를 갖는 다중 관계형 데이터베이스 테이블을 차별적 비밀보장 하에 합성하기 위한 최초의 프레임워크로, 잠재 변수를 갖는 그래픽 모델을 사용하여 관계 간 상관관계를 포착한다. 이 프레임워크는 임의의 비순환 외래 키 스키마를 지원하며, 인구 조사 및 TPC-H 데이터셋에서 집계 쿼리에 대해 기존 방법보다 높은 정확도를 보인다.

ABSTRACT

Answering database queries while preserving privacy is an important problem that has attracted considerable research attention in recent years. A canonical approach to this problem is to use synthetic data. That is, we replace the input database R with a synthetic database R* that preserves the characteristics of R, and use R* to answer queries. Existing solutions for relational data synthesis, however, either fail to provide strong privacy protection, or assume that R contains a single relation. In addition, it is challenging to extend the existing single-relation solutions to the case of multiple relations, because they are unable to model the complex correlations induced by the foreign keys. Therefore, multi-relational data synthesis with strong privacy guarantees is an open problem. In this paper, we address the above open problem by proposing PrivLava, the first solution for synthesizing relational data with foreign keys under differential privacy, a rigorous privacy framework widely adopted in both academia and industry. The key idea of PrivLava is to model the data distribution in R using graphical models, with latent variables included to capture the inter-relational correlations caused by foreign keys. We show that PrivLava supports arbitrary foreign key references that form a directed acyclic graph, and is able to tackle the common case when R contains a mixture of public and private relations. Extensive experiments on census data sets and the TPC-H benchmark demonstrate that PrivLava significantly outperforms its competitors in terms of the accuracy of aggregate queries processed on the synthetic data.

연구 동기 및 목표

  • 외래 키가 있는 다중 관계형 데이터베이스에 대해 강력한 프라이버시 보장 합성 데이터 생성의 부족을 해결하기 위해.
  • 차별적 비밀보장 하에 외래 키 제약 조건에 의해 유도되는 복잡한 관계 간 상관관계를 모델링하기 위해.
  • 단일 데이터베이스 스키마 내에서 공개 및 비공개 관계를 혼합으로 지원하기 위해.
  • 합성 데이터에서 집계 쿼리를 정확하게 답변하면서 철저한 프라이버시 보장을 보장하기 위해.
  • 단일 관계 차별적 비밀보장 솔루션을 외래 키 참조 무결성을 갖춘 다중 관계 환경으로 확장하기 위해.

제안 방법

  • PrivLava는 외래 키에 의해 유도되는 관계 간 의존성을 나타내기 위해 잠재 변수를 갖는 그래픽 모델을 사용하여 데이터 분포를 모델링한다.
  • 합성 과정을 관계 간 공동 분포의 차별적 비밀보장 추정으로 설정하며, 외래 키 제약 조건을 통합한다.
  • 이 프레임워크는 다수의 관계에 걸쳐 임의의 방향 비순환 그래프(DAG) 형태의 외래 키 참조를 지원한다.
  • 그래픽 모델의 파라미터에 대해 라플라스 또는 가우시안 노이즈와 같은 차별적 비밀보장 메커니즘을 사용하여 프라이버시 보장 파라미터 추정을 통합한다.
  • 일부 관계는 공개이고 다른 일부는 비공개일 수 있는 혼합 스키마를 허용하여 탄력적인 데이터 합성을 가능하게 한다.
  • 합성 데이터는 학습된 차별적 비밀보장 그래픽 모델에서 샘플링하여 생성된다.

실험 결과

연구 질문

  • RQ1외래 키를 갖는 합성 관계형 데이터를 강력한 차별적 비밀보장 보장을 유지하면서 생성할 수 있는가?
  • RQ2외래 키 제약 조건에 의해 유도되는 다중 관계 간 복잡한 상관관계를 프라이버시 보장 방식으로 모델링할 수 있는가?
  • RQ3프레임워크는 공개 및 비공개 관계를 모두 포함하는 혼합 스키마를 처리할 수 있는가?
  • RQ4차별적 비밀보장 하에서 합성 데이터에서의 집계 쿼리 정확도는 기존 방법과 비교해 어떻게 되는가?
  • RQ5TPC-H 및 인구 조사 데이터와 같은 실제 데이터베이스 스키마에서 이 접근법은 확장 가능하고 효과적인가?

주요 결과

  • PrivLava는 모두 인구 조사 및 TPC-H 벤치마크 데이터셋에서 기존 기준보다 훨씬 높은 정확도를 보이며 집계 쿼리에 대해 성능을 높였다.
  • 프레임워크는 임의의 비순환 외래 키 관계를 지원하여 복잡한 다중 관계 스키마의 모델링이 가능하다.
  • 공개 및 비공개 관계를 효과적으로 처리하여 일부 관계가 민감하지 않더라도 강력한 프라이버시 보장을 유지한다.
  • 그래픽 모델 내 잠재 변수의 사용은 외래 키에 의해 유도되는 관계 간 의존성을 정확히 포착할 수 있게 한다.
  • 실증 평가 결과, PrivLava는 차별적 비밀보장 하에서 최신 단일 관계 및 다중 관계 합성 방법보다 쿼리 정확도에서 뛰어난 성능을 보였다.
  • 이 방법은 실제 데이터베이스 스키마에 잘 스케일업되며, 적대적 쿼리 워크로드 조건에서도 프라이버시를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.