[논문 리뷰] Fed-TGAN: Federated Learning Framework for Synthesizing Tabular Data
Fed-TGAN은 프라이버시를 보존하는 인코딩과 표 간 유사도 가중치를 이용한 합의를 통해 표 형식 GAN에 대한 연합 학습 프레임워크를 제시하며, 기저선보다 더 빠른 수렴과 더 높은 데이터 유사성을 달성합니다.
Generative Adversarial Networks (GANs) are typically trained to synthesize data, from images and more recently tabular data, under the assumption of directly accessible training data. Recently, federated learning (FL) is an emerging paradigm that features decentralized learning on client's local data with a privacy-preserving capability. And, while learning GANs to synthesize images on FL systems has just been demonstrated, it is unknown if GANs for tabular data can be learned from decentralized data sources. Moreover, it remains unclear which distributed architecture suits them best. Different from image GANs, state-of-the-art tabular GANs require prior knowledge on the data distribution of each (discrete and continuous) column to agree on a common encoding -- risking privacy guarantees. In this paper, we propose Fed-TGAN, the first Federated learning framework for Tabular GANs. To effectively learn a complex tabular GAN on non-identical participants, Fed-TGAN designs two novel features: (i) a privacy-preserving multi-source feature encoding for model initialization; and (ii) table similarity aware weighting strategies to aggregate local models for countering data skew. We extensively evaluate the proposed Fed-TGAN against variants of decentralized learning architectures on four widely used datasets. Results show that Fed-TGAN accelerates training time per epoch up to 200% compared to the alternative architectures, for both IID and Non-IID data. Overall, Fed-TGAN not only stabilizes the training loss, but also achieves better similarity between generated and original data. Our code is released at https://github.com/zhao-zilong/Fed-TGAN.
연구 동기 및 목표
- 분산된 클라이언트 간에 원시 데이터를 공유하지 않고 CTGAN 스타일 표 형식 GAN 학습을 가능하게 한다.
- 개인 데이터를 노출하지 않고 글로벌 인코더를 초기화하기 위한 프라이버시 보존 열 인코딩을 개발한다.
- 비 IID 표 형식 데이터 하에서 로컬 모델을 집계하기 위한 표 유사도 인식 가중치를 설계한다.
- 여러 데이터셋에서 기저선 대비 더 빠른 수렴 및 생성 데이터와 실제 데이터 간의 유사성 증가를 입증한다.
제안 방법
- 각 클라이언트가 로컬 생성기 및 판별기를 학습하는 연합 학습 구조를 채택하는 연합자와 다수의 클라이언트를 사용하는 구조를 채택한다.
- 원시 데이터에 접근하지 않고 글로벌 인코더를 구성하기 위해 열 통계(범주형 빈도 및 연속형 VGM 매개변수)를 수집하여 프라이버시 보존 특성 인코딩을 구현한다.
- 클라이언트에 LE_j 및 VGM_j와 같은 글로벌 인코더를 배포하여 입력/출력 구조를 통합된 상태로 모델을 초기화한다.
- 클라이언트별 분산(범주형에 대한 Jensen-Shannon, 연속에 대한 Wasserstein)과 데이터 양을 사용해 각 클라이언트의 가중치를 산정한 후 소프트맥스 정규화를 통한 가중 합치를 적용한다.
- 비동기 학습 라운드와 중앙집계화를 위한 PyTorch RPC를 사용하여 구현하고 GPU-CPU 데이터 전송 한계를 다룬다.
실험 결과
연구 질문
- RQ1Fed-TGAN이 프라이버시를 보존하면서 분산 데이터로 표 형식 GAN을 학습할 수 있는가?
- RQ2프라이버시 보존 초기화 및 표 인식 가중치가 IID 및 non-IID 조건에서 수렴 속도와 데이터 현실성을 향상시키는가?
- RQ3Fed-TGAN의 결과가 표 형식 데이터셋에서 중앙 집중식 CTGAN, 일반 FL 및 다-판별기 MD-GAN과 어떻게 비교되는가?
주요 결과
- Fed-TGAN은 다-판별기 기저선에 비해 에폭당 훈련 시간을 최대 200%까지 단축한다.
- Ideal IID 케이스에서 Fed-TGAN은 기저선보다 실제 데이터에 더 높은 유사성(평균 JSD 및 평균 WD 감소)을 달성한다.
- 클라이언트 간 데이터 불균형 하에서 Fed-TGAN은 일반적인 FL-TGAN보다 더 빠르게 수렴한다.
- 얼리배본(비용분해)에서 표-유사도 가중치를 제거하면 성능이 저하되어 그 유용성을 확인한다.
- Fed-TGAN은 non-IID 분산 데이터에서도 안정적인 수렴과 향상된 유사성을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.