[논문 리뷰] CoDi: Co-evolving Contrastive Diffusion Models for Mixed-type Tabular Synthesis
CoDi는 연속형 및 이산형 변수를 동시에 처리하는 혼합형 테이블 데이터 합성에 대해, 상호 조화를 이룬 두 개의 확산 모델을 사용하는 새로운 프레임워크를 제안한다. 이 모델들은 상호 조건부로 설정되며, 음성 샘플링을 통한 대비 학습을 통해 공동 최적화된다. 이 방법은 11개의 실제 데이터셋에서 샘플링 품질과 다양성 측면에서 최신 기술(SOTA)을 초월하며, 학습 난이도를 낮추고 샘플링 속도를 약 90% 향상시킨다.
With growing attention to tabular data these days, the attempt to apply a synthetic table to various tasks has been expanded toward various scenarios. Owing to the recent advances in generative modeling, fake data generated by tabular data synthesis models become sophisticated and realistic. However, there still exists a difficulty in modeling discrete variables (columns) of tabular data. In this work, we propose to process continuous and discrete variables separately (but being conditioned on each other) by two diffusion models. The two diffusion models are co-evolved during training by reading conditions from each other. In order to further bind the diffusion models, moreover, we introduce a contrastive learning method with a negative sampling method. In our experiments with 11 real-world tabular datasets and 8 baseline methods, we prove the efficacy of the proposed method, called CoDi.
연구 동기 및 목표
- 현재 방법들이 상호 변수 간 상관관계를 손상시키는 경향이 있는 혼합형 테이블 데이터(연속형 및 이산형 변수)의 생성 모델링 과제를 해결하기 위해.
- 연속형 및 이산형 변수를 각각의 물리적 공간에서 처리함으로써, 공통의 연속 공간으로 매핑하는 것보다 더 정확한 분포 학습을 가능하게 하여 합성 테이블 데이터의 정밀도와 다양성을 향상시키기 위해.
- 연속형 및 이산형 확산 모델 간의 정렬을 향상시키기 위해 상호 조화를 이룬 조건부 학습과 구조화된 음성 샘플링을 통한 대비 학습을 통해.
- 기존의 단일 확산 프로세스에서 혼합 유형을 공동으로 모델링하는 방법에 비해 학습의 불안정성과 수렴 속도를 개선하기 위해.
- 테이블 데이터 합성에서 생성 학습의 삼중 과제(품질, 다양성, 일반화)를 균형 있게 해결하기 위해.
제안 방법
- 연속형 변수를 위한 연속 공간에서, 이산형 변수를 위한 이산 공간에서 각각 별도의 확산 모델을 학습함으로써, 각 유형에 대해 더 정확한 분포 학습이 가능해진다.
- 모든 시간 단계에서 서로의 전진 및 역방향 과정을 조건부로 설정함으로써, 두 모델이 상호 조화를 이루며, 서로의 업데이트가 변수 간 의존성을 유지하도록 한다.
- 각 모델에 대해 별도의 대비 학습 목표를 적용하며, 앵커(원본 샘플), 양성 샘플(올바른 조건으로 생성된 샘플), 음성 샘플(혼돈된 조건으로 생성된 샘플)을 사용하여 표현을 정렬한다.
- 음성 샘플링은 연속형 샘플을 생성할 때 이산 조건을 무작위로 뒤섞음으로써 구현되며, 이는 모델이 잘못된 상관관계를 거부하도록 학습시킨다.
- 대비 손실는 학습 중 공동 최적화되며, 이는 두 모델 간의 정렬을 강화하고 일반화 능력을 향상시킨다.
- 이 프레임워크는 이중 인코딩을 제외한 별도의 전처리/후처리 없이 엔드 투 엔드로 학습되며, 이산 변수에 대한 원-핫 인코딩 외에는 추가 처리가 없다. 이는 연속 공간에서의 열악한 샘플링을 방지한다.
실험 결과
연구 질문
- RQ1연속형 및 이산형 테이블 변수에 대해 별도의 확산 모델을 사용하는 것이 단일 공간에서의 공동 모델링에 비해 생성 품질을 향상시킬 수 있는가?
- RQ2연속형 및 이산형 확산 모델 간의 상호 조화를 이룬 조건부 학습이 혼합형 컬럼 간의 상호 변수 간 상관관계를 유지하는가?
- RQ3구조화된 음성 샘플링을 통한 대비 학습이 이산형 및 연속형 확산 모델 간의 정렬을 향상시키고 샘플의 다양성을 증가시킬 수 있는가?
- RQ4기존 최신 기술 기반의 테이블 합성 모델과 비교할 때, 제안된 방법은 학습 안정성과 수렴 속도 측면에서 어떻게 성능을 내는가?
- RQ5기존 방법에 비해 이 방법은 생성 학습의 삼중 과제(품질, 다양성, 일반화)를 더 잘 균형 잡는가?
주요 결과
- CoDi는 11개의 실제 테이블 데이터셋에서 8개의 기준 모델을 모두 압도하며 샘플링 품질과 다양성 측면에서 뛰어난 성능을 보였다. 분류 및 회귀 작업에서 F1 점수와 R² 모두 유의미한 향상이 있었다.
- Bank 데이터셋에서 CoDi는 F1 점수 0.566 ± 0.014를 기록했으며, 대비 학습을 적용하지 않은 기준 모델(0.527 ± 0.032) 대비 7.4% 향상된 성과를 보였다.
- Heart 데이터셋에서 CoDi는 기준 모델 대비 샘플링 다양성을 7.8% 향상시켰으며, 커버리지 점수는 0.949 ± 0.012를 기록했다.
- 대비 학습 구성 요소는 학습 안정성을 크게 향상시켰으며, Faults 데이터셋에서 매끄러운 손실 곡선을 보였고, 다른 음성 샘플링 방법에 비해 변동성이 큰 곡선을 보이는 것과 대비되었다.
- STaSy(이전의 SOTA) 대비 CoDi는 샘플링 시간을 약 90% 감소시켰다. 이는 더 나은 모델 정렬 덕분에 학습 난이도가 감소했기 때문이다.
- 절단 실험에서 대비 학습을 제거한 결과 11개 데이터셋 중 7개에서 성능 저하가 발생했으며, 이는 대비 학습이 품질과 다양성 향상에 핵심적인 역할을 한다는 것을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.