[논문 리뷰] DTGAN: Differential Private Training for Tabular GANs
DTGAN은 표본 데이터 합성용으로 차별적 비밀보장 조건부 워셔스타인 GAN을 제안하며, 생성자 또는 판별자 중 하나에서 DP-SGD를 사용하여 훈련한다. 엄격한 비밀보장 예산 ε=1 하에서 4개의 기계학습 모델에 대해 평균 정밀도가 18% 향상되었으며, 멤버십 공격 성공률는 약 50%로 효과적으로 제한되었다.
Tabular generative adversarial networks (TGAN) have recently emerged to cater to the need of synthesizing tabular data -- the most widely used data format. While synthetic tabular data offers the advantage of complying with privacy regulations, there still exists a risk of privacy leakage via inference attacks due to interpolating the properties of real data during training. Differential private (DP) training algorithms provide theoretical guarantees for training machine learning models by injecting statistical noise to prevent privacy leaks. However, the challenges of applying DP on TGAN are to determine the most optimal framework (i.e., PATE/DP-SGD) and neural network (i.e., Generator/Discriminator)to inject noise such that the data utility is well maintained under a given privacy guarantee. In this paper, we propose DTGAN, a novel conditional Wasserstein tabular GAN that comes in two variants DTGAN_G and DTGAN_D, for providing a detailed comparison of tabular GANs trained using DP-SGD for the generator vs discriminator, respectively. We elicit the privacy analysis associated with training the generator with complex loss functions (i.e., classification and information losses) needed for high quality tabular data synthesis. Additionally, we rigorously evaluate the theoretical privacy guarantees offered by DP empirically against membership and attribute inference attacks. Our results on 3 datasets show that the DP-SGD framework is superior to PATE and that a DP discriminator is more optimal for training convergence. Thus, we find (i) DTGAN_D is capable of maintaining the highest data utility across 4 ML models by up to 18% in terms of the average precision score for a strict privacy budget, epsilon = 1, as compared to the prior studies and (ii) DP effectively prevents privacy loss against inference attacks by restricting the success probability of membership attacks to be close to 50%.
연구 동기 및 목표
- 멤버십 공격 및 속성 유추 공격으로 인한 표본 GAN의 비밀보장 유출 위험을 해결한다.
- 표본 GAN에서 차별적 비밀보장(DP)을 적용할 최적의 위치—생성자 또는 판별자—를 평가한다.
- 표본 GAN을 위한 비밀보장 훈련에 있어 DP-SGD와 PATE의 효과성을 비교한다.
- 실제 세계의 유추 공격에 대한 DP-정규화된 GAN의 경험적 강건성을 평가한다.
- DP 훈련에서 복잡한 생성자 손실(분류 및 정보 손실)의 비밀보장 비용을 정량화한다.
제안 방법
- 고품질의 표본 데이터 합성을 위한 기울기 보정이 있는 조건부 워셔스타인 GAN인 DTGAN을 제안한다.
- 두 가지 변형을 도입한다: DTGAN D(DP-SGD가 판별자에 적용된 경우)와 DTGAN G(DP-SGD가 생성자에 적용된 경우).
- 추가 생성자 손실(분류 및 정보 손실)의 비밀보장 비용을 고려하기 위해 레니 지수 비밀보장(RDP) 분석을 적용한다.
- 두 변형 모두에서 훈련 중 비밀보장 예산 소모를 줄이기 위해 표본 추출을 사용한다.
- 이론적 비밀보장 보장을 확보하기 위해 백프로파게이션 중 노이즈 주입을 포함한 DP-SGD를 사용한다.
- 멤버십 및 속성 유추 공격 평가에 나이브 및 상관 기반 특징 추출을 모두 활용한다.
실험 결과
연구 질문
- RQ1엄격한 비밀보장 예산 하에서 표본 GAN 훈련에 있어 DP-SGD와 PATE 중 어느 프레임워크가 더 효과적인가?
- RQ2표본 GAN에서 비밀보장과 데이터 유효성의 균형을 고려할 때, DP-SGD를 생성자에 적용할 것인지 판별자에 적용할 것인지가 더 최적인가?
- RQ3복잡한 생성자 손실(분류 및 정보 손실)의 포함이 DP 훈련에서 전체 비밀보장 예산에 어떤 영향을 미치는가?
- RQ4실제로 DP-정규화된 표본 GAN은 멤버십 및 속성 유추 공격에 얼마나 잘 저항하는가?
- RQ5표본 GAN의 다양한 DP 훈련 구성에서 데이터 유효성과 비밀보장 간의 상충 관계는 어떠한가?
주요 결과
- 모든 평가 지표에서 DP-SGD는 PATE 프레임워크를 초월하여 데이터 유효성에서 뛰어난 성능을 보였으며, ε=1 하에서 이전 연구 대비 평균 정밀도 점수가 18% 향상된 DTGAN D를 기록하였다.
- 판별자에 DP-SGD를 적용한 DTGAN D는 가장 뛰어난 전체 데이터 유효성을 달성했으며, DTGAN G보다 훈련 수렴에 더 유리한 것으로 나타났다.
- DTGAN D와 DTGAN G에 대한 멤버십 유추 공격 성공률는 약 50%로 감소하여 강력한 비밀보장 보호를 나타낸다.
- 더 높은 유효성에도 불구하고, DTGAN G는 PATE-GAN과 DP-WGAN보다 속성 유추 공격에 약간 덜 강건함을 보여, 유효성-비밀보장 상충 관계를 확인하였다.
- 모든 DP 기반 모델, DTGAN 포함, 멤버십 공격 성공률는 근사적으로 무작위 성능(약 50%)으로 감소하여 이론적 비밀보장 보장을 확인하였다.
- 분류 및 정보 손실과 같은 추가 생성자 손실의 비밀보장 비용은 레니 지수 DP를 통해 엄밀히 정량화되었으며, 정확한 예산 계산이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.