Skip to main content
QUICK REVIEW

[논문 리뷰] TabMT: Generating tabular data with masked transformers

Manbir Gulati, Paul F. Roysdon|arXiv (Cornell University)|2023. 12. 11.
Digital and Cyber Forensics인용 수 6
한 줄 요약

TabMT는 이질적 데이터 유형, 결측치, 프라이버시 트레이드오프를 처리하기 위해 향상된 마스킹 기법을 활용하는 새로운 마스킹 트랜스포머 아키텍처를 제안한다. 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 품질, 다양성, 내구성 면에서 GAN, VAE, 순차적 모델들을 능가한다. 특히 온도 조절을 통한 프라이버시 보호 생성에서 뛰어난 성능을 보인다.

ABSTRACT

Autoregressive and Masked Transformers are incredibly effective as generative models and classifiers. While these models are most prevalent in NLP, they also exhibit strong performance in other domains, such as vision. This work contributes to the exploration of transformer-based models in synthetic data generation for diverse application domains. In this paper, we present TabMT, a novel Masked Transformer design for generating synthetic tabular data. TabMT effectively addresses the unique challenges posed by heterogeneous data fields and is natively able to handle missing data. Our design leverages improved masking techniques to allow for generation and demonstrates state-of-the-art performance from extremely small to extremely large tabular datasets. We evaluate TabMT for privacy-focused applications and find that it is able to generate high quality data with superior privacy tradeoffs.

연구 동기 및 목표

  • 기존 접근 방식의 한계를 해결하고, 견고하고 확장 가능하며 프라이버시를 고려한 합성 탭두럴 데이터용 생성 모델을 개발한다.
  • 소형에서 대형에 이르기까지 다양한 크기의 데이터셋에서 고품질 탭두럴 데이터를 효과적으로 생성할 수 있도록 한다.
  • 보정 또는 사전 처리 없이도 학습 및 생성 과정에서 결측 데이터를 내재적으로 처리할 수 있도록 한다.
  • 온도 스케일링을 통한 융통성 있는 프라이버시 트레이드오프 메커니즘을 제공하여 데이터 유용성과 프라이버시를 제어할 수 있도록 한다.
  • GAN, VAE, 순차적 트랜스포머를 포함한 기존 생성 모델들보다 품질과 구조적 정밀도 면에서 뛰어난 성능을 입증한다.

제안 방법

  • TabMT는 탭두럴 필드 전역에서 양방향으로 마스킹 토큰을 예측하는 마스킹 트랜스포머 아키텍처를 사용하여 이질적 데이터 유형을 종합적으로 모델링한다.
  • 각 행에 고유한 마스킹 확률을 적용하는 학습 가능한 마스킹 전략을 사용하여 생성 과정에서의 조건부 조절 유연성을 높인다.
  • 모델은 마스킹된 토큰을 문맥으로부터 재구성하는 목적으로 훈련되며, 이는 표현 학습을 향상시킨다.
  • 샘플별로 필드 수준 표현의 평균을 취해 임베딩을 생성하고, 이는 Fréchet Inception Distance(FID)와 Inception Score를 통한 후행 평가에 사용된다.
  • 추론 시 온도 스케일링을 지원하여 데이터 품질과 프라이버시 사이의 트레이드오프를 제어할 수 있으며, 모드 붕괴를 줄이고 다양성을 향상시킨다.
  • 연속형 필드에 정량화를 적용하여 이산 토큰화를 가능하게 하여 학습 및 생성 과정을 촉진하면서도 데이터 구조를 유지한다.
Figure 2 : A row of data being sampled from TabMT. Fields are sampled in a random order and field values are sampled according to the predicted distributed.
Figure 2 : A row of data being sampled from TabMT. Fields are sampled in a random order and field values are sampled according to the predicted distributed.

실험 결과

연구 질문

  • RQ1마스킹 트랜스포머 아키텍처가 다양한 데이터셋에서 합성 탭두럴 데이터 생성 분야에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2TabMT는 학습 및 생성 과정에서 결측 데이터를 어떻게 처리하며, 이는 데이터 품질과 프라이버시에 어떤 영향을 미치는가?
  • RQ3온도 스케일링을 통해 TabMT는 프라이버시와 데이터 품질을 어느 정도 균형 잡을 수 있으며, 다른 프라이버시 보호 방법과 비교해 볼 때 어떤가?
  • RQ4NFGAN과 같은 전용 모델과 비교해 볼 때, TabMT는 넷플로우 데이터 생성과 같은 도메인 특화 벤치마크에서 어떻게 성능을 내는가?
  • RQ5TabMT는 다양한 크기의 데이터셋에서 어떻게 확장 가능한가? 모델 크기가 생성 품질과 다양성에 어떤 영향을 미치는가?

주요 결과

  • TabMT는 넷플로우 데이터셋에서 정밀도 88.10%와 재현율 91.12%를 기록했으며, NFGAN의 77.64% 정밀도와 63.32% 재현율을 능가했다.
  • TabMT-L은 넷플로우 데이터셋에서 99.43%의 다양성을 기록했고, NFGAN의 46.97%에 비해 우수한 샘플 커버리지와 모드 붕괴 감소를 보였다.
  • TabMT는 넷플로우 인variants의 중앙값 위반률을 NFGAN 대비 20배 감소시켰으며, TCP 플래그의 경우 오류율 6.54e-06, 프라이빗 IP의 경우 1.14e-05로 가장 낮은 오류율을 기록했다.
  • 모델 크기(소형에서 대형)에 관계없이 모든 크기에서 정밀도와 재현율이 검증 세트 수준에 가까워지는 강력한 확장성 확보.
  • 가장 큰 모델인 TabMT-L을 사용할 경우 넷플로우 데이터셋에서 100%의 다양성을 달성하여 데이터 분포의 거의 완벽한 커버리지가 가능했다.
  • 모델의 마스킹 메커니즘이 결측 데이터를 내재적으로 처리할 수 있도록 하여, 결측 기록이 많은 실제 환경에서의 강인성과 적용 가능성을 향상시켰다.
TabMT: Generating tabular data with masked transformers

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.