Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple Imputation Through XGBoost

Yongshi Deng, Thomas Lumley|arXiv (Cornell University)|2021. 06. 03.
Statistical Methods and Bayesian Inference참고 문헌 20인용 수 6
한 줄 요약

이 논문은 XGBoost, 서브샘플링, 예측 평균 매칭을 활용한 확장 가능한 다중 보정 프레임워크인 mixgb를 제안한다. 이는 복잡한 데이터 구조를 가진 대규모 데이터셋을 효과적으로 다룰 수 있도록 한다. 보정 정확도와 계산 효율성 측면에서 뛰어난 성능을 보이며, 특히 GPU 가속 기능을 통해 기존의 mice-cart 및 mice-ranger와 같은 전통적 방법들을 뛰어넘는다. 이는 편향과 분산 측면에서 모두 슈퍼리어한 성능를 보이며, 통계적 타당성도 유지한다.

ABSTRACT

The use of multiple imputation (MI) is becoming increasingly popular for addressing missing data. Although some conventional MI approaches have been well studied and have shown empirical validity, they have limitations when processing large datasets with complex data structures. Their imputation performances usually rely on the proper specification of imputation models, which requires expert knowledge of the inherent relations among variables. Moreover, these standard approaches tend to be computationally inefficient for medium and large datasets. In this paper, we propose a scalable MI framework mixgb, which is based on XGBoost, subsampling, and predictive mean matching. Our approach leverages the power of XGBoost, a fast implementation of gradient boosted trees, to automatically capture interactions and non-linear relations while achieving high computational efficiency. In addition, we incorporate subsampling and predictive mean matching to reduce bias and better account for appropriate imputation variability. The proposed framework is implemented in an R package mixgb. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 대규모 데이터셋과 변수 간 비선형 관계가 복잡한 데이터에서 기존의 다중 보정(MI) 방법의 한계를 해결하기 위해.
  • 수동으로 모델을 지정할 필요 없이 상호작용과 비선형 효과를 모두 포착할 수 있는 확장 가능하고 자동화된 MI 프레임워크를 개발하기 위해.
  • 기존의 MI 방법이 실용성이 떨어지는 중간 및 대규모 데이터셋에서 계산 효율성을 향상시키기 위해.
  • 서브샘플링과 예측 평균 매칭(PMM)을 통합하여 편향을 줄이고 불확실성을 더 잘 반영하기 위해.
  • XGBoost 기반 보정 성능을 기존의 mice-cart 및 mice-ranger와 같은 표준 MI 방법과 비교하여 편향, 분산, 런타임 측면에서 평가하기 위해.

제안 방법

  • 프레임워크는 XGBoost를 사용해 누락된 변수의 조건부 분포를 모델링하며, 명시적인 모델 지정 없이도 비선형성과 상호작용을 자동으로 포착한다.
  • 학습 중 서브샘플링을 적용하여 과적합을 줄이고 보정의 변동성을 높여 불확실성 표현을 향상시킨다.
  • 예측 평균 매칭(PMM)을 사용해 유사한 관측 사례에서 보정된 값을 생성함으로써 데이터의 분포적 성질을 유지한다.
  • 반복적이지 않은 방법이지만, mixgb R 패키지를 통해 다중 반복을 허용하며 CPU 및 GPU 가속 기능을 지원한다.
  • 변수는 누락 수에 따라 정렬되어 순서대로 보정되어 안정성 향상과 오류 전파 감소를 도모한다.
  • 구현은 CRAN과 GitHub에 공개된 R 패키지(mixgb)로 제공되며, CPU 및 GPU 실행 모두를 지원한다.

실험 결과

연구 질문

  • RQ1XGBoost 기반 보정에 서브샘플링과 PMM를 적용할 경우, 복잡한 데이터 구조에서 표준 MI 방법보다 낮은 편향과 더 나은 분산 추정을 달성할 수 있는가?
  • RQ2mixgb의 계산 성능는 mice-cart 및 mice-ranger 대비 데이터셋 크기가 증가함에 따라 어떻게 변화하는가?
  • RQ3XGBoost 보정에 서브샘플링을 포함시키면 보정의 변동성 향상과 과적합 감소에 기여하는가?
  • RQ4estimation 정확도 및 불확실성 표현 측면에서 mixgb는 mice-ranger 및 mice-cart보다 어떻게 성능을 발휘하는가?
  • RQ5GPU 가속은 특히 대규모 데이터셋에서 mixgb의 런타임에 어떤 영향을 미치는가?

주요 결과

  • mixgb-sub(서브샘플링 포함)는 모든 시뮬레이션 시나리오에서 평균 편향이 가장 낮게 나타났으며, mice-default, mice-cart, mice-ranger를 모두 앞섰다.
  • mixgb-sub는 가장 우수한 보정 간 분산을 보이며, 우수한 불확실성 정량화 능력을 입증했다.
  • mixgb-gpu 버전은 전체적으로 가장 빠른 성능를 보였으며, 특히 대규모 데이터셋에서 서브샘플링의 영향을 거의 느끼지 못했다.
  • 작은 데이터셋에서는 mixgb-cpu가 mice-ranger보다 느렸지만, 더 큰 데이터셋에서는 mixgb-gpu가 속도에서 mice-ranger를 앞섰다.
  • MAR 메커니즘 하에서 높은 누락률 조건에서도 완전 사례 분석이 실패하는 상황에서도 높은 보정 품질을 유지했다.
  • 결과적으로 mixgb-sub-gpu는 정확도, 낮은 편향, 높은 계산 효율성의 균형을 이룬 바람직한 선택으로, 대규모이고 복잡한 데이터셋에 최적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.