[논문 리뷰] MissDiff: Training Diffusion Models on Tabular Data with Missing Values
MissDiff는 사전 보정 없이 결측치가 있는 표본 데이터에 직접 훈련되는 새로운 확산 기반 생성 프레임워크를 제안한다. Denoising Score Matching에서 마스킹된 회귀 손실을 사용하여 일致한 점수 학습을 보장한다. 다양한 실세계 데이터셋과 결측 메커니즘에서 품질과 유틸리티 측면에서 '보정-생성' 파이프라인을 포함한 최신 기법들보다 큰 폭으로 슈퍼리어리티를 보인다.
The diffusion model has shown remarkable performance in modeling data distributions and synthesizing data. However, the vanilla diffusion model requires complete or fully observed data for training. Incomplete data is a common issue in various real-world applications, including healthcare and finance, particularly when dealing with tabular datasets. This work presents a unified and principled diffusion-based framework for learning from data with missing values under various missing mechanisms. We first observe that the widely adopted "impute-then-generate" pipeline may lead to a biased learning objective. Then we propose to mask the regression loss of Denoising Score Matching in the training phase. We prove the proposed method is consistent in learning the score of data distributions, and the proposed training objective serves as an upper bound for the negative likelihood in certain cases. The proposed framework is evaluated on multiple tabular datasets using realistic and efficacious metrics and is demonstrated to outperform state-of-the-art diffusion model on tabular data with "impute-then-generate" pipeline by a large margin.
연구 동기 및 목표
- 의료, 금융, 사회 시스템에서 흔히 발생하는 완전하지 않은 표본 데이터에 대한 생성 모델 훈련 문제를 해결하기 위해.
- '보정-생성' 파이프라인의 한계를 극복하여 편향을 유발하고 데이터 다양성을 감소시킬 수 있는 문제를 해결하기 위해.
- 삭제나 보정 없이 결측 데이터로부터 원칙적으로 학습하는 통합된 프레임워크를 개발하기 위해.
- 약한 결측 메커니즘 조건 하에서 점수 함수 복원과 음의 로그우도 상한선에 대한 이론적 근거를 제공하기 위해.
- 여러 표본 데이터셋에서 데이터 품질과 후속 작업 유틸리티 측면에서 MissDiff의 슈퍼리어리티를 경험적으로 검증하기 위해.
제안 방법
- 훈련 중 결측치를 다루기 위해 Denoising Score Matching(DSM)에 마스킹된 회귀 손실을 제안하여 보정을 피한다.
- 결측 데이터 패턴을 점수 매칭 과정에 직접 통합하는 수정된 훈련 목표를 도입한다.
- 이론적으로 진정한 점수 함수 학습의 일致성과 약한 결측성 가정 하에서 음의 로그우도 상한선을 보장하는 프레임워크를 제공한다.
- 연속형 및 이산형 특성 모두를 포함하는 혼합형 표본 데이터에 적용하여 두 유형의 특성에서의 결측치를 처리한다.
- 손실이 결측 항목에서 마스킹되는 디노이징 점수 매칭 목표를 사용하여, 모델이 편향 없이 관측된 데이터로부터 학습하도록 보장한다.
- 생성과 보정을 모두 지원하는 통합 아키텍처를 활용하여 이중 목적의 유용성을 실현한다.
실험 결과
연구 질문
- RQ1사전 보정 없이 결측치가 있는 표본 데이터에 대해 확산 모델을 효과적으로 훈련시킬 수 있는가?
- RQ2점수 매칭에서 제안된 마스킹 손실이 진정한 데이터 점수 함수를 일관되게 추정하는가?
- RQ3MissDiff는 '보정-생성' 기준 기법들에 비해 데이터 품질과 후속 작업 유틸리티 측면에서 어떻게 성능을 냈는가?
- RQ4MAR 및 NMAR와 같은 비MCAR 결측 메커니즘 하에서 MissDiff는 얼마나 잘 일반화되는가?
- RQ5MissDiff는 생성을 위해 설계되었지만, 실제로는 효과적인 보정 모델로 기능할 수 있는가?
주요 결과
- MCAR 조건 하에서 Census 데이터셋에서 MissDiff는 독립적 결측성 하에서 83.16%의 품질을 기록했으며, 이는 다음으로 우수한 방법인 STaSy-mean(26.1% 향상)을 크게 앞서나갔다.
- 행 기반 결측성 하에서 MissDiff는 80.59%의 분류 정확도를 기록했으며, Diff-mean(76.92%)과 STaSy-mean(56.75%)를 크게 앞서나갔다.
- 대규모 MIMIC-4ED 데이터셋에서 행 기반 결측성 하에서 MissDiff는 84.45%의 품질을 기록했으며, Diff-delete(성능 기록 없음)와 Diff-mean(75.22%)를 모두 뛰어넘었다.
- MIMIC-4ED에서 RMSE 기반 유틸리티 평가에서 MissDiff는 행 기반 결측성 하에서 1.826의 성능을 기록했으며, Diff-mean(2.166)과 STaSy-mean(1.894)를 모두 능가했다.
- Census 데이터셋에서 MAR 및 NMAR 메커니즘 하에서 MissDiff는 각각 77.45% 및 77.88%의 품질을 기록했으며, 모든 설정에서 Diff-delete 및 Diff-mean을 모두 앞섰다.
- 보정 성능 측정에서 MissDiff는 Census 데이터셋에서 RMSE 0.087을 기록했으며, CSDI-T(0.099)와 GAIN(0.123)을 모두 능가하여 강력한 보정 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.