Skip to main content
QUICK REVIEW

[논문 리뷰] VAEs in the Presence of Missing Data

Mark Collier, Alfredo Nazábal|arXiv (Cornell University)|2020. 06. 09.
Energy Load and Power Forecasting참고 문헌 20인용 수 10
한 줄 요약

이 논문은 결측 데이터를 오염 과정으로 모델링하는 새로운 VAE 프레임워크를 제안하며, 인코더와 디코더 양쪽에 결측 지표를 통합함으로써 MCAR 및 MNAR 데이터를 원칙적으로 다룰 수 있도록 한다. 이 방법은 기존 접근 방식에 비해 MNIST와 SVHN에서 더 높은 주변 로그우도와 더 나은 착수 성능을 달성한다.

ABSTRACT

Real world datasets often contain entries with missing elements e.g. in a medical dataset, a patient is unlikely to have taken all possible diagnostic tests. Variational Autoencoders (VAEs) are popular generative models often used for unsupervised learning. Despite their widespread use it is unclear how best to apply VAEs to datasets with missing data. We develop a novel latent variable model of a corruption process which generates missing data, and derive a corresponding tractable evidence lower bound (ELBO). Our model is straightforward to implement, can handle both missing completely at random (MCAR) and missing not at random (MNAR) data, scales to high dimensional inputs and gives both the VAE encoder and decoder principled access to indicator variables for whether a data element is missing or not. On the MNIST and SVHN datasets we demonstrate improved marginal log-likelihood of observed data and better missing data imputation, compared to existing approaches.

연구 동기 및 목표

  • 기존 VAE 방법이 고차원 설정에서 결측 데이터를 다루는 데에 한계가 있음을 해결하기 위해.
  • 결측 데이터를 오염 과정으로 모델링하는 생성 모델을 개발하여 간편한 추론을 가능하게 하기 위해.
  • 아키텍처 제약 없이 인코더와 디코더 양쪽에 결측 지표(m)에 대한 액세스를 제공하기 위해.
  • MCAR 및 MNAR 가정 하에 관측된 데이터의 확률적 모델링과 결측 데이터 착수를 향상시키기 위해.

제안 방법

  • 결측 데이터가 오염 과정을 통해 생성되는 잠재 변수 모델을 도입하며, 관측된(1) 및 결측된(0) 요소를 나타내는 이진 마스크 벡터 m을 사용한다.
  • 결측 데이터 하에서 log p(x_o|m)의 간편한 하한 근사(ELBO)를 유도하여, 결측 데이터 하에서 VAE의 엔드 투 엔드 학습을 가능하게 한다.
  • 인코더와 디코더를 수정하여 결측 지표 m에 조건을 두어, 양쪽 네트워크가 어떤 입력이 결측되었는지 고려할 수 있도록 한다.
  • 생성 모델 p(x|m, z)와 추론 모델 q(z|x̃, m)를 함께 최적화하는 조건부 VAE 프레임워크를 사용한다.
  • 테스트 세트에서 주변 로그우도와 착수 품질을 추정하기 위해 중요도 표본추출(256개 표본)을 활용한다.
  • 결측 지표를 잠재 메커니즘으로 모델링함으로써 무작위 또는 무시 가능 결측을 가정하지 않고, MCAR 및 MNAR 결측 모두를 지원한다.

실험 결과

연구 질문

  • RQ1고차원 입력에서 아키텍처 제약 없이 VAE를 효과적으로 결측 데이터 처리에 적응시키는 방법은 무엇인가?
  • RQ2디코더가 결측 지표(m)에 액세스함으로써 모델 성능과 착수 품질에 미치는 영향은 무엇인가?
  • RQ3일관된 방식으로 MCAR 및 MNAR 결측을 모두 처리할 수 있는 통합된 오염 과정 생성 모델은 가능한가?
  • RQ4주변 로그우도와 착수 정확도 측면에서 기존 접근 방식에 비해 제안된 방법은 어떻게 비교되는가?
  • RQ5마스크 m에 조건을 두는 것이 오염된 입력에서 모호한 이미지 패턴의 해석을 향상시키는가?

주요 결과

  • ED Ind. 방법(인코더와 디코더 양쪽이 m에 액세스)은 MCAR 및 MNAR 설정 하에서 MNIST와 SVHN 양쪽에서 No Ind. 기준선에 비해 관측 데이터의 주변 로그우도가 유의미하게 높다.
  • EO Ind. 변종(인코더만 m을 사용)은 No Ind.에 비해 성능 향상을 보였지만, ED Ind. 변종은 착수 품질에서 통계적으로 유의미한 향상을 보였다.
  • 시각화 결과는 ED Ind.가 결측 마스크의 전체 구조를 활용하여 모호한 숫자(예: 7 vs. 9, 2 vs. 1)의 재구성에서 더 정확한 복원을 이룬다는 것을 보여준다.
  • paired t-tests를 통해 60개의 랜덤 시드에서 통계적으로 유의미한 결과를 확보함으로써, Nazabal 등(2018)에 비해 로그우도 및 착수 지표에서 모두 우수한 성능을 보였다.
  • 결측 마스크를 통합함으로써 계산 오버헤드가 거의 없이 고차원 입력(MNIST 및 SVHN)에 효과적으로 스케일링된다.
  • 제거 분석 결과, 디코더가 m에 액세스하는 것이 인코더만 액세스하는 것보다 착수 품질 향상에 더 큰 기여를 하며, 로그우도 향상의 여유는 작지만 일관되게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.