Skip to main content
QUICK REVIEW

[논문 리뷰] Imputation and low-rank estimation with Missing Not At Random data

Aude Sportisse, Claire Boyer|arXiv (Cornell University)|2018. 12. 29.
Tensor decomposition and applications참고 문헌 41인용 수 4
한 줄 요약

이 논문은 Missing Not At Random (MNAR) 데이터를 위한 두 가지 새로운 행렬 완성 방법을 제안한다. 이는 EM 알고리즘을 통한 모델 기반 추정과 FISTA를 결합하며, 데이터와 누락 패턴을 함께 모델링하기 위해 병합된 데이터-마스크 행렬에 저질서 구조를 적용하는 계산적으로 효율적인 서브스티튜션 접근법을 사용한다. 이 방법은 MNAR 메커니즘 하에서 강력한 대체값 설정과 추정을 달성하며, 외상 레지스트리에서 전신용 혈액응고억제제 사용에 대한 임상 예측 변수를 활용하여 검증되었다.

ABSTRACT

Missing values challenge data analysis because many supervised and unsupervised learning methods cannot be applied directly to incomplete data. Matrix completion based on low-rank assumptions are very powerful solution for dealing with missing values. However, existing methods do not consider the case of informative missing values which are widely encountered in practice. This paper proposes matrix completion methods to recover Missing Not At Random (MNAR) data. Our first contribution is to suggest a model-based estimation strategy by modelling the missing mechanism distribution. An EM algorithm is then implemented, involving a Fast Iterative Soft-Thresholding Algorithm (FISTA). Our second contribution is to suggest a computationally efficient surrogate estimation by implicitly taking into account the joint distribution of the data and the missing mechanism: the data matrix is concatenated with the mask coding for the missing values; a low-rank structure for exponential family is assumed on this new matrix, in order to encode links between variables and missing mechanisms. The methodology that has the great advantage of handling different missing value mechanisms is robust to model specification errors.The performances of our methods are assessed on the real data collected from a trauma registry (TraumaBase ) containing clinical information about over twenty thousand severely traumatized patients in France. The aim is then to predict if the doctors should administrate tranexomic acid to patients with traumatic brain injury, that would limit excessive bleeding.

연구 동기 및 목표

  • 관측되지 않은 값에 따라 누락이 발생하는 정보적 누락 데이터 문제를 해결하기 위해.
  • 저질서 행렬 복구에서 누락 데이터 메커니즘을 명시적으로 고려하는 모델 기반 추정 전략을 개발하기 위해.
  • 데이터-마스크 확장 행렬에 저질서 구조를 적용하여 데이터와 누락 패턴의 공동 분포를 암묵적으로 모델링하는 계산적으로 효율적인 서브스티튜션 방법을 제안하기 위해.
  • MNAR 메커니즘 하에서 모델 잘못 지정에 대한 강건성을 확보하기 위해.
  • 외상성 뇌손상 환자에서 전신용 혈액응고억제제 투여를 예측하기 위한 실제 임상 데이터에서 성능을 평가하기 위해.

제안 방법

  • 누락 메커니즘이 데이터와 마스크에 대한 로지스틱 회귀를 통해 명시적으로 모델링되는 모델 기반 추정 전략을 사용하는 EM 알고리즘을 적용한다.
  • M단계에서 핵심 노름 정규화를 통한 저질서 행렬 추정을 위해 FISTA(Fast Iterative Soft-Thresholding Algorithm)를 구현한다.
  • 데이터 행렬과 누락 값의 이진 마스크를 병합한 후, 병합된 행렬에 저질서 구조를 가정하는 서브스티튜션 방법을 도입한다. 이는 지수족 분포에 대해 적용된다.
  • 현재 파라미터 추정치를 기반으로 누락 값의 후행 분포를 근사하기 위해 SIR(Sequential Importance Resampling)를 통한 중요도 샘플링을 적용한다.
  • M단계에서 이진 연결을 가진 일반선형모형을 사용하여 누락 메커니즘의 파라미터를 추정하며, 대체된 데이터를 기반으로 누락 모델을 업데이트한다.
  • 핵심 노름 펜alties를 가진 저질서 행렬 추정 문제를 해결하기 위해 M단계에서 소프트-아이미프 유사 업데이트를 활용한다.

실험 결과

연구 질문

  • RQ1데이터가 Missing Not At Random (MNAR)일 경우, FISTA를 통한 모델 기반 EM 접근법이 저질서 행렬을 효과적으로 복원할 수 있는가?
  • RQ2데이터-마스크 병합 행렬에 저질서 구조를 적용하여 데이터와 누락 패턴을 공동으로 모델링하면 대체값 설정 정확도와 강건성이 향상되는가?
  • RQ3표준 행렬 완성 기법과 비교할 때, 제안된 방법은 모델 잘못 지정 상황에서 어떻게 성능을 보이는가?
  • RQ4정보적 누락이 존재하는 실제 외상 데이터에서 임상 결과(예: 전신용 혈액응고억제제 사용)를 신뢰성 있게 예측할 수 있는가?
  • RQ5다양한 누락 메커니즘이 MNAR 환경에서 저질서 행렬 완성의 성능에 어떤 영향을 미치는가?

주요 결과

  • 누락 메커니즘을 명시적으로 모델링한 제안된 EM-FISTA 방법은 표준 저질서 방법에 비해 MNAR 데이터에서 대체값 설정 정확도를 크게 향상시킨다.
  • 데이터-마스크 행렬을 단일 저질서 객체로 간주하는 서브스티튜션 방법은 계산 비용을 줄이고 모델 잘못 지정에 대한 강건성이 높아져 경쟁적인 성능을 달성한다.
  • TraumaBase® 데이터셋(20,000명 이상의 환자 포함)을 통해 정보적 누락이 존재하는 상황에서도 저질서 구조를 성공적으로 복원하였다.
  • SIR 기반의 대체값 설정 단계는 누락 값의 후행 분포를 효과적으로 근사하여 EM 알고리즘의 안정적인 파라미터 업데이트를 가능하게 하였다.
  • 이진 연결을 가진 일반선형모형을 사용한 누락 모델링은 MNAR 메커니즘의 민감하고 해석 가능한 추정을 가능하게 하였다.
  • 실증 결과에 따르면, 이 방법은 MNAR 데이터 존재 하에서 전신용 혈액응고억제제 투여와 같은 임상적으로 중요한 결과의 예측 성능을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.