[논문 리뷰] Classification and regression tree methods for incomplete data from sample surveys
이 논문은 분류 및 회귀 트리(CART)와 랜덤 포레스트를 사용하여 완전하지 않은 설문 조사 데이터에서 결과 변수와 보조 변수에 누락된 값을 처리하는 방법을 제안하며, 기존의 보정 및 가중치 방법에 비해 편향, 평균 제곱 오차, 계산 속도 및 고차원 예측 변수에 대한 확장성 측면에서 뛰어난 성능을 보임을 실질적인 미국 소비지출 조사 데이터를 통해 입증한다.
Analysis of sample survey data often requires adjustments to account for missing data in the outcome variables of principal interest. Standard adjustment methods based on item imputation or on propensity weighting factors rely heavily on the availability of auxiliary variables for both responding and non-responding units. Application of these adjustment methods can be especially challenging in cases for which the auxiliary variables are numerous and are themselves subject to substantial incomplete-data problems. This paper shows how classification and regression trees and forests can overcome some of the computational difficulties. An in-depth simulation study based on incomplete-data patterns encountered in the U.S. Consumer Expenditure Survey is used to compare the methods with two standard methods for estimating a population mean in terms of bias, mean squared error, computational speed and number of variables that can be analyzed.
연구 동기 및 목표
- 결과 변수와 보조 변수가 모두 누락된 자료에서 표본 조사에서 모집단 평균을 추정하는 데 도전하는 것.
- 고차원이고 완전하지 않은 보조 자료를 다룰 때 다중 보정 및 역확률가중치와 같은 표준 방법의 계산 및 모델링 한계를 극복하는 것.
- 나무 기반 방법, 예를 들어 CART와 랜덤 포레스트가 완전하지 않은 설문 조사 자료에 대해 더 강건하고 빠르며 확장 가능한 해결책을 제공할 수 있는지 평가하는 것.
- 편향, 평균 제곱 오차, 계산 효율성 및 많은 수의 예측 변수를 다룰 수 있는 능력 측면에서 나무 기반 방법을 기존의 방법과 비교하는 것.
제안 방법
- 저자들은 결과 변수와 보조 예측 변수 간의 관계를 모델링하기 위해 분류 및 회귀 트리(CART)와 랜덤 포레스트를 적용하며, 보조 변수 자체에 누락된 값이 포함된 경우에도 가능하다.
- 나무 모델에서 예측된 평균을 사용하여 누락된 결과 값의 보정을 수행하며, 이는 강한 파rametric 가정을 피하는 예측 평균 모델을 형성한다.
- 재귀적 분할을 활용하여 유사한 반응 패턴을 보이는 하위군을 식별함으로써, 완전 자료 가정이 필요 없는 비모수적 방식으로 누락된 값을 추정한다.
- 계산 효율성을 위해 랜덤 포레스트를 이용한 앙상블 학습을 활용하여 예측 값의 분산을 줄이고 정확도를 향상시킨다.
- 실제로 미국 소비지출 조사에서 얻은 완전하지 않은 자료 패턴을 기반으로 한 시뮬레이션 연구를 통해 표준 방법인 다중 보정의 연쇄 방정식(MICE), AMELIA, 역확률가중치(IPW)와 비교한다.
- 편향, 평균 제곱 오차, 계산 속도 및 효과적으로 다룰 수 있는 예측 변수의 수를 사용하여 나무 기반 방법의 성능을 평가한다.
실험 결과
연구 질문
- RQ1보조 변수가 완전하지 않은 경우에도 분류 및 회귀 트리가 설문 조사 결과의 누락된 자료를 효과적으로 다룰 수 있는가?
- RQ2나무 기반 방법은 모집단 평균을 추정할 때 표준 보정 및 가중치 기법에 비해 편향과 평균 제곱 오차 측면에서 어떻게 비교되는가?
- RQ3CART와 랜덤 포레스트는 설문 조사 자료에서 예측 변수에 누락된 값이 있는 고차원 예측 변수 세트에 얼마나 잘 확장되는가?
- RQ4기존의 다중 보정 또는 EM 기반 방법에 비해 나무 기반 보정은 계산 속도를 얼마나 향상시키는가?
- RQ5미국 소비지출 조사와 같은 대규모 설문 조사에서 관찰된 현실적인 누락 자료 패턴 하에서 나무 기반 방법은 얼마나 잘 성능을 발휘하는가?
주요 결과
- 복잡한 누락 자료 패턴 하에서 모집단 평균을 추정할 때 나무 기반 방법이 MICE 및 IPW와 같은 표준 방법보다 편향이 낮았다.
- 특히 고차원적이고 상관관계가 있는 보조 변수가 있는 상황에서 전통적 접근보다 평균 제곱 오차가 낮았다.
- MICE 및 AMELIA보다 계산 속도가 뚜렷이 빨라졌으며, 수천 개의 예측 변수를 효율적으로 처리할 수 있었다.
- 랜덤 포레스트는 특히 예측 변수에 누락된 값이 있는 고차원 설정에서 분산을 줄이고 예측 정확도를 향상시키기 위해 단일 트리보다 우수한 성능을 보였다.
- 완전 케이스 분석이나 강한 파arametric 가정 없이도 완전하지 않은 보조 변수를 효과적으로 처리하였다.
- 다양한 누락 자료 메커니즘 하에서도 강건한 성능을 유지했으며, 예측 변수의 수가 표본 크기를 초과할 경우 특히 효과적이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.