Skip to main content
QUICK REVIEW

[논문 리뷰] DPD-fVAE: Synthetic Data Generation Using Federated Variational Autoencoders With Differentially-Private Decoder

Bjarne Pfitzner, Bert Arnrich|arXiv (Cornell University)|2022. 11. 21.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

DPD-fVAE는 디커파이어러를 디코더에만 적용하는 분산 변동 자동부호화기(federated variational autoencoder)를 제안하며, 노이즈 요구량을 줄이고 합성 데이터 품질을 향상시킨다. 이는 MNIST, Fashion-MNIST, CelebA에서 경쟁적인 FID 점수와 분류기 정확도를 달성하면서도 분산 학습과 미분적 비밀유지 기법을 통해 클라이언트 데이터의 기밀성을 유지한다.

ABSTRACT

Federated learning (FL) is getting increased attention for processing sensitive, distributed datasets common to domains such as healthcare. Instead of directly training classification models on these datasets, recent works have considered training data generators capable of synthesising a new dataset which is not protected by any privacy restrictions. Thus, the synthetic data can be made available to anyone, which enables further evaluation of machine learning architectures and research questions off-site. As an additional layer of privacy-preservation, differential privacy can be introduced into the training process. We propose DPD-fVAE, a federated Variational Autoencoder with Differentially-Private Decoder, to synthesise a new, labelled dataset for subsequent machine learning tasks. By synchronising only the decoder component with FL, we can reduce the privacy cost per epoch and thus enable better data generators. In our evaluation on MNIST, Fashion-MNIST and CelebA, we show the benefits of DPD-fVAE and report competitive performance to related work in terms of Fréchet Inception Distance and accuracy of classifiers trained on the synthesised dataset.

연구 동기 및 목표

  • 의료 분야와 같은 분산된 기밀성이 중요한 데이터셋에서 고품질의 합성 데이터를 생성하는 데 도전한다.
  • VAE의 디코더 구성 요소에만 미분적 비밀유지를 적용하여 분산 학습에서의 비밀유지 비용을 줄인다.
  • 하위 기계학습 작업을 위한 효과적인 동시에 기밀 보장을 갖춘 분산 환경에서의 데이터 생성 모델 학습을 가능하게 한다.
  • 중앙적 및 국지적 미분적 비밀유지 환경에서 비밀유지 예산, 모델 성능, 데이터 품질 간의 상호 상충 관계를 평가한다.

제안 방법

  • 에코더는 로컬에서 유지되고 기밀을 유지하며, 디코더만 공유되고 분산 평균화를 통해 업데이트되는 분산 VAE 아키텍처를 사용한다.
  • L2-노름 클리핑과 노이즈 주입을 사용하여 디코더의 기울기들에만 미분적 비밀유지를 적용함으로써 클라이언트당 비밀유지 비용을 최소화한다.
  • 클래스 레이블을 통합하여 클래스별로 합성 이미지를 생성할 수 있는 조건부 VAE를 사용한다.
  • 중앙적 미분적 비밀유지(CDP)와 국지적 미분적 비밀유지(LDP) 두 가지 비밀유지 제도를 평가하며, 비교를 위해 (ε=10, δ=10−5)의 초모수를 사용한다.
  • 학습 과정은 표준 VAE 목표를 사용하며, 잠재 공간에서의 재표본화 기법과 KL 발산 정규화를 포함한다.
  • 모델 성능 평가는 합성 데이터에 대한 Fréchet Inception Distance(FID)와 하위 분류기 정확도를 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1분산 VAE의 디코더에만 미분적 비밀유지를 적용함으로써 노이즈 부담을 줄이면서도 고품질의 합성 데이터 생성을 유지할 수 있는가?
  • RQ2DPD-fVAE의 FID 점수와 분류기 정확도에서 비공개 및 중앙적 비밀유지 기반 기준 모델과의 성능 비교는 어떻게 되는가?
  • RQ3국지적 미분적 비밀유지가 분산 환경에서 모델 수렴과 합성 데이터 품질에 어떤 영향을 미치는가?
  • RQ4DPD-fVAE는 원시 클라이언트 데이터를 폭로하지 않고도 고품질의 클래스 균형 잡힌 합성 데이터를 생성하여 하위 모델 평가를 지원할 수 있는가?

주요 결과

  • DPD-fVAE는 (10,10−5)-DP 조건에서 MNIST에서 FID 56.9, Fashion-MNIST에서 FID 84.4를 기록하여 동일 조건에서의 이전 방법들을 능가했다.
  • MNIST에서 DPD-fVAE가 생성한 데이터로 훈련된 CNN 분류기는 91.3%의 정확도를 달성했으며, 비연합 기반 최신 기술 수준의 방법과 유사한 성능을 보였다.
  • 엄격한 국지적 미분적 비밀유지(LDP) 조건에서도 모델은 고품질의 이미지를 성공적으로 생성했고, 표준 분산 VAE는 동일 조건에서 수렴하지 못했다.
  • CelebA 합성 데이터는 FID 261.7, CNN 정확도 69.0%를 기록하여 클라이언트 데이터 접근성은 낮지만 실현 가능성을 입증했다.
  • CDP 기반 DPD-fVAE는 MNIST에서 FID 76.4, 분류기 정확도 88.1%를 기록하여 중앙적 비밀유지 보장 조건에서도 뛰어난 성능을 보였다.
  • 디코더에만 노이즈를 집중시킴으로써 동일한 비밀유지 예산에서도 더 나은 모델 성능을 달성할 수 있도록 하여, 비밀유지에 필요한 노이즈 양을 크게 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.