Skip to main content
QUICK REVIEW

[논문 리뷰] Robin Hood and Matthew Effects: Differential Privacy Has Disparate Impact on Synthetic Data

Georgy Ganev, Bristena Oprisanu|arXiv (Cornell University)|2021. 09. 23.
Privacy-Preserving Technologies in Data인용 수 10
한 줄 요약

이 논문은 차별적 개인정보보호(DP)가 합성 표본 데이터를 생성하는 생성 모델에서 소수자 집단에 비해 불균형하게 영향을 미치는 방식을 조사한다. DP는 균형을 깨뜨리는 '로빈 후드 효과'(균형 감소) 또는 균형을 심화시키는 '마태오 효과'(균형 증가)를 유도할 수 있으며, 이는 높은 개인정보 보호 예산과 데이터 불균형 조건에서 하류 분류기의 정확도에 차별적인 저하를 초래한다. 특히 소수자 클래스에서 두드러진다.

ABSTRACT

Generative models trained with Differential Privacy (DP) can be used to generate synthetic data while minimizing privacy risks. We analyze the impact of DP on these models vis-a-vis underrepresented classes/subgroups of data, specifically, studying: 1) the size of classes/subgroups in the synthetic data, and 2) the accuracy of classification tasks run on them. We also evaluate the effect of various levels of imbalance and privacy budgets. Our analysis uses three state-of-the-art DP models (PrivBayes, DP-WGAN, and PATE-GAN) and shows that DP yields opposite size distributions in the generated synthetic data. It affects the gap between the majority and minority classes/subgroups; in some cases by reducing it (a "Robin Hood" effect) and, in others, by increasing it (a "Matthew" effect). Either way, this leads to (similar) disparate impacts on the accuracy of classification tasks on the synthetic data, affecting disproportionately more the underrepresented subparts of the data. Consequently, when training models on synthetic data, one might incur the risk of treating different subpopulations unevenly, leading to unreliable or unfair conclusions.

연구 동기 및 목표

  • DP 생성 모델이 생성한 합성 표본 데이터의 클래스 및 하위집단 분포에 대한 DP의 영향을 분석하는 것.
  • DP 생성 데이터로 학습된 분류기가 DP 분류기에서 관찰된 바와 같이 동일한 정확도에 대한 차별적 영향을 미치는지 조사하는 것, 특히 소수자 하위집단에 대해.
  • 다양한 DP 메커니즘(Laplace, DP-SGD, PATE)과 다양해지는 개인정보 보호 예산 및 데이터 불균형 수준이 합성 데이터의 공정성과 유효성에 미치는 영향을 평가하는 것.
  • DP 생성 모델이 하위집단 표현에 편향을 유발하고 소수자 집단의 하류 성능을 떨어뜨리는 조건을 특정하는 것.

제안 방법

  • 최신 DP 생성 모델 세 종류를 평가: PrivBayes(Laplace 메커니즘), DP-WGAN(DP-SGD), PATE-GAN(개인정보 보호 기반 교사 앙상블 집합).
  • 통제된 클래스 및 하위집단 불균형 수준을 가진 표본 데이터셋에 각 모델을 훈련하고, 다양한 개인정보 보호 예산(에프리콘) 설정을 통해 분석.
  • 모델 및 설정 별로 다수의 합성 데이터셋을 생성하여 신뢰구간 계산 및 통계적 안정성 평가.
  • 합성 데이터로 이진 및 다중 클래스 분류기를 훈련하고, 각 클래스 및 하위집단의 정확도를 측정하여 유효성 격차 탐지.
  • 실제 데이터와 합성 데이터의 하위집단 크기 분포를 비교하여 불균형 이동 정도를 정량화(예: 로빈 후드 대비 마태오 효과).
  • 개인정보 보호 예산, 데이터 불균형, 모델 아키텍처가 공정성 및 유효성 지표에 미치는 영향을 분리하기 위한 분석 연구 수행.

실험 결과

연구 질문

  • RQ1RQ1: DP 생성 모델은 실제 데이터 분포를 반영한 클래스 및 하위집단 비율을 가진 합성 데이터를 생성하는가?
  • RQ2RQ2: DP 합성 데이터로 분류기를 훈련하면, 실제 데이터에서 DP 분류기를 훈련할 때 관찰된 바와 같이 동일한 정확도에 대한 차별적 영향을 겪는가?
  • RQ3RQ3: 다양한 DP 메커니즘(Laplace, DP-SGD, PATE)과 변화하는 개인정보 보호 예산 및 데이터 불균형 수준이 합성 데이터의 공정성과 유효성에 어떤 영향을 미치는가?

주요 결과

  • DP 생성 모델은 하위집단 분포에 대해 상반된 영향을 미친다: PrivBayes는 불균형을 감소시켜 '로빈 후드 효과'를 유도하지만, PATE-GAN은 불균형을 증가시켜 '마태오 효과'를 유도한다.
  • 모든 DP 생성 모델이 하류 분류기의 정확도 저하에 비례적으로 영향을 미치며, 특히 소수자 하위집단에서 성능 저하가 더 크고 변동성이 크다.
  • 개인정보 보호 보장 수준이 높을수록(에프리콘 값이 낮을수록) 크기 및 정확도 격차의 정도가 증가하며, 특히 극도로 불균형한 데이터셋에서 두드러진다.
  • PATE-GAN은 다중 클래스, 극도로 불균형한 데이터에서 희귀 하위집단을 학습하는 데 심각한 실패를 보이며, 낮은 개인정보 보호 예산 조건에서 하위집단과 목표 변수 간 인위적인 상관관계를 생성한다.
  • PATE-GAN에서 생성된 합성 데이터로 학습한 분류기의 유효성은 종종 DP-WGAN보다 유사하거나 더 높지만, 이는 하위집단 표현의 편향과 신뢰할 수 없는 하위집단 수준의 성능을 대가로 치르는 것이다.
  • 생성 모델, DP 메커니즘, 개인정보 보호 예산의 선택은 공정성 결과에 크게 영향을 미치며, 개인정보 보호 기반 합성 데이터 생성에 대해 한 가지 크기의 솔루션이 존재하지 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.