Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrapping and Multiple Imputation Ensemble Approaches for Missing Data

Shehroz S. Khan, Amir Ahmad|arXiv (Cornell University)|2018. 02. 01.
Bayesian Methods and Mixture Models참고 문헌 32인용 수 9
한 줄 요약

이 논문은 부트스트래핑과 다중 보정을 조합한 앙상블 방법을 제안하여 누락 데이터 하에서 분류 성능을 향상시킨다. 완전하지 않은 데이터에서 기대값 최대화 보정을 부트스트래핑과 융합함으로써, 이 방법은 높은 누락률(최대 30%)에서도 정확도와 다양성 측면에서 강건성을 확보하며, 8개의 UCI 데이터셋에서 실시한 광범위한 실험에서 단일 보정 및 다른 앙상블 전략을 능가한다.

ABSTRACT

Presence of missing values in a dataset can adversely affect the performance of a classifier. Single and Multiple Imputation are normally performed to fill in the missing values. In this paper, we present several variants of combining single and multiple imputation with bootstrapping to create ensembles that can model uncertainty and diversity in the data, and that are robust to high missingness in the data. We present three ensemble strategies: bootstrapping on incomplete data followed by (i) single imputation and (ii) multiple imputation, and (iii) multiple imputation ensemble without bootstrapping. We perform an extensive evaluation of the performance of the these ensemble strategies on 8 datasets by varying the missingness ratio. Our results show that bootstrapping followed by multiple imputation using expectation maximization is the most robust method even at high missingness ratio (up to 30%). For small missingness ratio (up to 10%) most of the ensemble methods perform quivalently but better than single imputation. Kappa-error plots suggest that accurate classifiers with reasonable diversity is the reason for this behaviour. A consistent observation in all the datasets suggests that for small missingness (up to 10%), bootstrapping on incomplete data without any imputation produces equivalent results to other ensemble methods.

연구 동기 및 목표

  • 기계학습에서 누락 데이터로 인한 분류기 성능 저하 문제를 해결하기 위해.
  • 불확실성과 데이터 다양성을 모델링하기 위해 부트스트래핑과 다중 보정을 조합한 앙상블 전략을 평가하기 위해.
  • 실제 데이터셋에서 높은 누락률 비율(최대 30%)에 대해 가장 강건한 접근 방식을 규명하기 위해.
  • 다양한 보정 및 앙상블 기법 간 정확도, 다양성, 계산 비용 간의 상충 관계를 분석하기 위해.
  • 누락 수준에 따라 최적의 보정 및 앙상블 전략을 선택하는 데 기초가 되는 근거를 데이터 과학자에게 제공하기 위해.

제안 방법

  • 세 가지 앙상블 전략을 제안한다: (i) 완전하지 않은 데이터에서 부트스트래핑을 수행한 후 단일 보정을 수행하고, (ii) 완전하지 않은 데이터에서 부트스트래핑을 수행한 후 다중 보정을 수행하며, (iii) 부트스트래핑 없이 다중 보정을 수행한다.
  • 기본 보정 기법으로 기대값 최대화(EM), 평균 보정, 무작위 보정을 앙상블 프레임워크 내에서 사용한다.
  • 앙상블는 부트스트래핑 샘플에서 훈련된 25개의 기저 분류기로 구성되며, 예측 결과는 다수결 투표 방식으로 집계된다.
  • 분류기 다양성(kappa)과 평균 오차(E_ij) 간의 상충 관계를 시각화하기 위해 카파-오차 플롯을 활용하며, 최적의 조합은 좌하단 코너에 위치한다.
  • 10배 교차검증을 사용하여 누락률이 5%에서 30% 사이인 8개의 UCI 데이터셋에서 성능을 평가한다.
  • 연구는 누락이 완전히 무작위로 발생하는(MCAR) 경우에 국한되며, 이 가정 하에 결과의 타당성을 확보한다.

실험 결과

연구 질문

  • RQ1증가하는 누락률 하에서, 부트스트래핑과 단일 보정을 조합한 전략, 부트스트래핑과 다중 보정을 조합한 전략, 또는 부트스트래핑 없이 다중 보정을 수행하는 전략 중 어느 것이 가장 우수한 성능을 보이는가?
  • RQ2다양한 누락률 비율(5%에서 30%)에서 앙상블 방법의 성능이 단일 보정과 비교하여 어떻게 되는가?
  • RQ3카파-오차 플롯은 누락 데이터 하에서 앙상블 분류기의 다양성과 정확도 간 관계를 어느 정도 드러내는가?
  • RQ4낮은 누락률(≤10%)에서, 보정 없이 완전하지 않은 데이터에서 부트스트래핑을 수행하는 것이 보정 기반 앙상블과 유사한 성능을 보이는가?
  • RQ5보정 방법의 선택(EM, 평균, 무작위)이 앙상블의 강건성과 계산 비용에 어떤 영향을 미치는가?

주요 결과

  • 기대값 최대화(EM) 기반 보정을 사용한 부트스트래핑과 다중 보정을 조합한 앙상블(BagEM)이 가장 강건하며, 30%의 누락률에서도 높은 성능을 유지한다.
  • 낮은 누락률(최대 10%)에서는 보정 없이 완전하지 않은 데이터에서 부트스트래핑를 수행한 방법(BagNoImp)이 모든 보정 기반 앙상블과 동등한 성능을 보이며, 이는 이러한 경우 보정의 필요성이 최소화됨을 시사한다.
  • 카파-오차 플롯은 BagEM이 높은 정확도와 합리적인 다양성을 갖춘 분류기를 생성함을 확인하며, 이는 고누락률에서의 뛰어난 강건성의 이유를 설명한다.
  • 부트스트래핑 후 평균 보정을 사용한 다중 보정(BagMIGRandI)은 낮은 누락률(≤10%)에서 EM 기반 보정 대비 더 빠르고 강건한 대안이 된다.
  • 단일 보정은 앙상블 방법에 비해 일관되게 열등한 성능을 보이며, 특히 10%를 초과하는 누락률에서 성능 저하가 심해진다.
  • 부트스트래핑 후 EM 기반 보정을 사용한 다중 보정의 성능은 30%의 누락률에서도 떨어지지 않아, 데이터의 불완전성에 대해 매우 강력한 내성적 특성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.