Skip to main content
QUICK REVIEW

[논문 리뷰] An Analysis of the Deployment of Models Trained on Private Tabular Synthetic Data: Unexpected Surprises

Mayana Pereira, Meghana Kshirsagar|arXiv (Cornell University)|2021. 06. 15.
Privacy-Preserving Technologies in Data참고 문헌 26인용 수 4
한 줄 요약

이 논문은 차별적 개인정보 보호(Private, DP) 합성 표본 데이터가 기계학습 모델의 유효성과 공정성에 미치는 영향을 조사한다. 높은 개인정보 보호 수준이 모델 유효성을 감소시키지만, 일관되게 편향을 증가시키지는 않는다는 점을 보여주며, 특히 공정성 지표에서 실세계 데이터에서의 성능이 훨씬 열 劣한 경향이 있음을 확인한다. 이는 테스트 프로토콜에 심각한 격차가 있음을 시사한다.

ABSTRACT

Diferentially private (DP) synthetic datasets are a powerful approach for training machine learning models while respecting the privacy of individual data providers. The effect of DP on the fairness of the resulting trained models is not yet well understood. In this contribution, we systematically study the effects of differentially private synthetic data generation on classification. We analyze disparities in model utility and bias caused by the synthetic dataset, measured through algorithmic fairness metrics. Our first set of results show that although there seems to be a clear negative correlation between privacy and utility (the more private, the less accurate) across all data synthesizers we evaluated, more privacy does not necessarily imply more bias. Additionally, we assess the effects of utilizing synthetic datasets for model training and model evaluation. We show that results obtained on synthetic data can misestimate the actual model performance when it is deployed on real data. We hence advocate on the need for defining proper testing protocols in scenarios where differentially private synthetic datasets are utilized for model training and evaluation.

연구 동기 및 목표

  • 차별적 개인정보 보호 합성 데이터가 표본 기반 기계학습에서 모델 유효성과 공정성에 미치는 영향을 조사하기.
  • 모델이 배포 시 실세계 데이터에서 성능을 어떻게 평가하는지에 대한 합성 데이터와 실세계 데이터 간의 성능 격리 정도를 평가하기.
  • 개선된 개인정보 보호 보장을 통해 후행 모델에서 편향이 증가하는지 평가하기.
  • 공정성을 유지하면서도 개인정보 보호를 확보하는 합성 데이터 생성 방법을 식별하기.
  • 모델 훈련 및 평가에 합성 데이터를 사용할 경우, 재검토된 테스트 프로토콜을 주장하기.

제안 방법

  • 저자는 PrivBayes, QUAIL+CTGAN, QUAIL+PATECTGAN 및 기타 합성기법을 사용해 생성한 차별적 개인정보 보장 합성 데이터와 실세계 데이터를 기반으로 분류 모델을 훈련시켰다.
  • 모델 성능은 AUC, 재현율(정확한 양성 비율, TPR), 양성 예측도(PPV) 등의 표준 지표를 사용해 평가하였으며, 합성 테스트 세트와 실세계 테스트 세트 간 성능을 비교하였다.
  • 개인정보 보호는 비용(ε) 값 0.1과 10을 사용해 제어하였으며, 이는 개인정보 보호-유효성 트레이드오프를 조절하기 위함이었다.
  • 공정성은 소수 집단과 다수 집단 간 성능 격차를 측정함으로써 하위군별 성능 지표를 사용해 평가하였다.
  • 일반화 능력을 평가하기 위해 Adult, COMPAS, Fair COMPAS 세 가지 벤치마크 데이터셋을 사용하였다.
  • 실험은 평가 시점(합성 데이터 기반)과 배포 시점(실세계 데이터 기반)의 성능을 비교하여 성능 이격 현상을 식별하였다.

실험 결과

연구 질문

  • RQ1차별적 개인정보 보호 합성 데이터에서 개인 정보 보호 예산(ε)을 증가시키면 모델 유효성과 공정성에 어떤 영향을 미치는가?
  • RQ2합성 데이터 생성 시 더 높은 개인정보 보호 수준이 후행 분류 모델의 편향을 증가시키는가?
  • RQ3합성 데이터에서의 모델 성능 지표가 실세계 데이터에서의 성능과 얼마나 관련이 있는가?
  • RQ4다른 합성 데이터 생성 프레임워크(예: PrivBayes 대비 QUAIL)는 공정성 결과에 어떤 영향을 미치는가?
  • RQ5합성 데이터에서만 훈련 및 평가된 모델이 실세계의 공정성과 유효성을 신뢰성 있게 예측할 수 있는가?

주요 결과

  • 차별적 개인정보 보호 합성 데이터에서 훈련된 모델은 개인정보 보호 수준이 높아질수록 유효성이 일관되게 감소함을 확인하였으며, 이는 개인정보 보호-유효성 트레이드오프를 뒷받침한다.
  • 유효성 감소에도 불구하고, 높은 개인정보 보호 수준이 반드시 편향 증가를 초래하는 것은 아니며, 공정성 결과는 합성기 종류에 따라 달라진다.
  • PrivBayes로 생성된 합성 데이터의 경우, 실세계 데이터에서의 AUC가 합성 테스트 데이터에서의 성능보다 높은 경우가 많아 실세계에서의 성능이 예상보다 우수함을 시사한다.
  • 반면, QUAIL+CTGAN 및 QUAIL+PATECTGAN로 생성된 합성 데이터에서 훈련된 모델은 평가에서의 배포로 이행할수록 유효성과 공정성이 일관되게 감소하였으며, 특히 ε 값이 낮을수록 두드러졌다.
  • 대부분의 합성기에서 TPR 및 PPV와 같은 공정성 지표는 평가에서 배포로 이행할수록 심각하게 악화되었으며, 이는 합성 데이터가 실세계의 편향을 과소 평가한다는 것을 의미한다.
  • 모든 합성기에서 유효성 또는 공정성 성능에 일관된 패턴이 없었으며, QUAIL+PATECTGAN는 데이터셋 및 ε 값에 따라 혼합된 결과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.