Skip to main content
QUICK REVIEW

[논문 리뷰] Causal-TGAN: Generating Tabular Data Using Causal Generative Adversarial Networks

Bingyang Wen, Luis Oliveros Colon|arXiv (Cornell University)|2021. 04. 21.
Privacy-Preserving Technologies in Data참고 문헌 13인용 수 7
한 줄 요약

Causal-TGAN은 구조적 인과 모델(Structural Causal Models, SCMs)을 활용한 새로운 생성적 적대적 신경망으로, 진정한 인과 그래프가 제공될 경우 상관 기반 GAN보다 분포 적합도와 기계학습 효용성에서 뛰어난 성능을 보인다. 시뮬레이션 데이터에서 기준 모델 대비 평균 29% 향상된 로그우도(log-likelihood)를 달성하며, 진정한 인과 구조가 아닌 추정된 인과 구조를 사용할 경우에도 경쟁력 있는 성능 유지를 보인다.

ABSTRACT

Synthetic data generation becomes prevalent as a solution to privacy leakage and data shortage. Generative models are designed to generate a realistic synthetic dataset, which can precisely express the data distribution for the real dataset. The generative adversarial networks (GAN), which gain great success in the computer vision fields, are doubtlessly used for synthetic data generation. Though there are prior works that have demonstrated great progress, most of them learn the correlations in the data distributions rather than the true processes in which the datasets are naturally generated. Correlation is not reliable for it is a statistical technique that only tells linear dependencies and is easily affected by the dataset's bias. Causality, which encodes all underlying factors of how the real data be naturally generated, is more reliable than correlation. In this work, we propose a causal model named Causal Tabular Generative Neural Network (Causal-TGAN) to generate synthetic tabular data using the tabular data's causal information. Extensive experiments on both simulated datasets and real datasets demonstrate the better performance of our method when given the true causal graph and a comparable performance when using the estimated causal graph.

연구 동기 및 목표

  • 기존 GAN 모델이 표본적 상관관계에 의존할 뿐 진정한 인과 메커니즘을 반영하지 못하는 한계를 해결하기 위해.
  • 실제 테이블형 데이터를 생성하는 배경이 되는 인과 과정을 모델링하여 합성 데이터 품질을 향상시키기 위해.
  • 진정한 인과 그래프가 알려지지 않은 상황에서도 추정된 인과 구조를 사용하여 강력한 성능을 유지할 수 있는 방법을 개발하기 위해.
  • 실제 및 시뮬레이션 데이터셋을 대상으로 분포 유사도 및 기계학습 효용성 메트릭을 사용해 모델을 평가하기 위해.

제안 방법

  • Causal-TGAN은 구조적 인과 모델(SCM) 내에서 인과 메커니즘을 학습하기 위해 적대적 훈련을 적용하며, 각 변수는 직접적인 원인과 외생 노이즈에 기반해 생성된다.
  • 모델은 인과 그래프(DAG)를 통해 인과 구조를 정의하며, 각 내생 변수 Xj는 Xj = Fj(부모(Xj), Uj)로 생성되며, 여기서 Uj는 외생 노이즈이다.
  • 연속 변수를 인코딩하기 위해 혼합 정규분포 모델(Gaussian Mixture Models, GMMs)을 사용하고, 이산 변수에는 원핫 인코딩을 적용하여 다중모달 및 범주형 데이터 생성을 가능하게 한다.
  • 생성자는 진짜 데이터와 합성 데이터를 구분하는 판별자에 대해 적대적으로 훈련되며, 생성자는 인과 그래프에 조건부로 설정된다.
  • 이 방법은 연속형, 범주형, 순서형 변수를 모두 지원하며, 이전의 인과 GAN이 이진형 또는 연속형 변수에만 국한된 것과는 달리 확장 가능하다.
  • 진정한 인과 그래프가 제공되지 않을 경우, Causal-TGAN은 데이터로부터 추정된 인과 구조를 사용하며, 벤치마크 전반에서 강력한 성능을 유지한다.

실험 결과

연구 질문

  • RQ1테이블형 데이터의 진정한 인과 구조를 모델링할 경우, 통계적 상관관계에 의존하는 것보다 더 우수한 합성 데이터 생성이 가능한가?
  • RQ2진정한 인과 그래프가 제공될 경우, Causal-TGAN은 최신 기술의 GAN과 비교해 어떻게 성능을 내는가?
  • RQ3진정한 인과 그래프 대신 추정된 인과 그래프를 사용할 경우 Causal-TGAN의 성능은 어떠한가?
  • RQ4Causal-TGAN은 기존 모델과 동일하게 분포 유사도를 유지하고 후속 기계학습 작업을 효과적으로 지원하는가?
  • RQ5인과 기반 생성 방식은 실제 테이블형 데이터셋에서 데이터 적합도와 유효성 모두를 향상시킬 수 있는가?

주요 결과

  • 진정한 인과 그래프를 사용할 경우, Causal-TGAN은 시뮬레이션 데이터에서 가장 높은 로그우도(-9.87 평균)를 기록하며, CTGAN 및 TableGAN을 포함한 모든 기준 모델을 능가한다.
  • 진정한 인과 그래프를 사용할 경우, Causal-TGAN은 시뮬레이션 데이터셋에서 다른 GAN 모델 대비 평균 로그우도 29% 향상을 달성한다.
  • 실제 데이터셋에서는 Causal-TGAN이 KS 및 CS 검정에서 평균 열 유사도 두 번째로 높은 성능을 기록하며, CTGAN과 함께 최고 성능 기록을 달성한다.
  • 기계학습 효용성 측면에서 Causal-TGAN은 adult 및 news 데이터셋에서 두 번째로 뛰어난 성능을 보이며, census 데이터셋에서는 상위권에 속하며, 회귀 작업에서 평균 R²가 -0.53을 기록한다.
  • 추정된 인과 그래프를 사용할 경우에도 Causal-TGAN은 경쟁력 있는 성능을 유지하며, 진정한 인과 구조가 자주 알려지지 않은 실세계 환경에서의 강건성을 입증한다.
  • 모델는 뛰어난 일반화 능력을 보이며, 다양한 테이블형 데이터 유형에 걸쳐 높은 분포 유사도와 효과적인 후속 작업 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.