[논문 리뷰] On the Use of Auxiliary Variables in Multilevel Regression and Poststratification
이 논문은 보조 변수 조건부로 포함 확률을 모델링하고, 추정된 포함 확률을 결과 모델의 예측변수로 통합함으로써 다수준 회귀 및 후편제어(MRP)의 성능을 햖थ한 통합 MRP 프레임워크를 제안한다. 이 방법은 모형 오Specification 상황에서도 추정 정확도를 향상시키며, ABCD 연구 데이터를 활용한 유한집단 추론에서 특히 소규모 하위군에 대해 훨씬 더 우수한 편향 제어 성능을 보이며, 표준 MRP보다 MRP-INT가 더 나은 성능을 보인다.
Multilevel regression and poststratification (MRP) is a popular method for addressing selection bias in subgroup estimation, with broad applications across fields from social sciences to public health. In this paper, we examine the inferential validity of MRP in finite populations, exploring the impact of poststratification and model specification. The success of MRP relies heavily on the availability of auxiliary information that is strongly related to the outcome. To enhance the fitting performance of the outcome model, we recommend modeling the inclusion probabilities conditionally on auxiliary variables and incorporating flexible functions of estimated inclusion probabilities as predictors in the mean structure. We present a statistical data integration framework that offers robust inferences for probability and nonprobability surveys, addressing various challenges in practical applications. Our simulation studies indicate the statistical validity of MRP, which involves a tradeoff between bias and variance, with greater benefits for subgroup estimates with small sample sizes, compared to alternative methods. We have applied our methods to the Adolescent Brain Cognitive Development (ABCD) Study, which collected information on children across 21 geographic locations in the U.S. to provide national representation, but is subject to selection bias as a nonprobability sample. We focus on the cognition measure of diverse groups of children in the ABCD study and show that the use of auxiliary variables affects the findings on cognitive performance.
연구 동기 및 목표
- 유한집단에서 다수준 회귀 및 후편제어(MRP)의 추론 타당성을 향상시켜 비확률 설문조사의 선택 편향을 해결하는 것.
- 보조 변수 선택 및 모형 사양이 소규모 하위군(표본 수가 제한된 경우)에서 MRP 성능에 미치는 영향을 조사하는 것.
- 확률 및 비확률 설문조사 데이터를 강건하고 모형 기반 추론을 통해 통합하는 데이터 통합 프레임워크를 개발하는 것.
- 추정된 포함 확률을 MRP 결과 모델의 예측변수로 포함시켜 모형 오Specification 상황에서 편향을 줄이는 효과를 평가하는 것.
- 공공보건 및 사회과학 연구의 실제 적용을 위한 MRP에서 보조 변수 모델링에 대한 실용적 지침을 제공하는 것.
제안 방법
- 보조 변수 조건부로 포함 확률을 로지스틱 회귀 또는 유사 모형을 사용해 추정함으로써 선택 경향을 모델링하는 것.
- 추정된 포함 확률을 결과 모델의 예측변수로 통합하며, 포함 확률의 이산값 별로 무작위 절편을 포함시켜 탄력적인 모델링을 허용하는 것.
- 다수준 회귀 프레임워크를 사용하고 계층적 사전분포를 적용하여 추정치를 정규화하고 소면적 예측 성능을 향상시키는 것.
- 기본 확률 샘플(예: ACS)에서 제공하는 알려진 인구 셀 크기를 사용해 후편제어를 수행함으로써 표본 추정치를 표적 집단에 캘리브레이션하는 것.
- 다중 착수를 통해 분산을 추정하고 불확실성을 반영하기 위해 합성 인구 생성 방법(예: WFPBB 알고리즘)을 구현하는 것.
- 결합 규칙(예: Dong 등, 2014)을 사용해 합성 인구 간 결과를 통합하고 강건한 신뢰구간을 계산하는 것.
실험 결과
연구 질문
- RQ1결과 모델에 추정된 포함 확률을 예측변수로 포함시킬 경우, 모형 오Specification 상황에서 MRP 성능에 어떤 영향을 미치는가?
- RQ2보조 변수 선택 및 모형 사양이 소규모 하위군에서 MRP 추정치의 편향과 분산에 어떤 영향을 미치는가?
- RQ3제안된 통합 MRP(MRP-INT) 프레임워크는 표준 MRP 및 역확률가중법(IPW)에 비해 추정 정확도와 강건성 측면에서 어떻게 비교되는가?
- RQ4선택을 예측할 수 있는 보조 변수를 포함시킬 경우, 비확률 표본에서의 유한집단 추론에 얼마나 기여하는가?
- RQ5결과 모형이 오Specification된 경우에도 제안된 프레임워크가 특히 소수 민족 집단과 같은 저소득 하위군에서 유효하고 강건한 추론을 제공할 수 있는가?
주요 결과
- 추정된 포함 확률을 예측변수로 포함한 MRP-INT는 특히 표본 수가 적은 하위군에서 MRP-P 및 MRP-R보다 더 안정적이고 편향이 적은 추정치를 도출하였다.
- 빈곤한 백인 어린이 하위군(n=291)의 경우, MRP-INT는 전체 모형 기준값에 비해 인지 능력 점수 추정치의 차이가 더 작았으며, 이는 모형 오Specification 상황에서 더 뛰어난 강건성을 보임을 시사한다.
- 단일 부모이며 노동력에 포함되지 않은 대규모 가정(가구 규모 >5)의 어린이 하위군(n=132)에서는, MRP-INT 추정치는 수입 및 노동력 상태 변수를 결과 모형에서 제거한 후에도 일관성 유지되었지만, MRP-P 추정치는 크게 변화하였다. 이는 MRP-INT가 모형 오Specification에 더 잘 견디는 것으로 나타났다.
- MRP-INT 하에서의 전체 인지 능력 점수 추정치는 85.91(95% 신뢰구간: 85.75, 86.07)이었으며, MRP-P 및 MRP와 유사하게 정확도가 높았고, 하위군 추정치의 정밀도와 강건성이 향상되었다.
- 역확률가중법(IPW)은 더 높은 추정치(86.20)와 넓은 신뢰구간(86.03, 86.36)을 보였으며, MRP 기반 방법에 비해 분산이 더 크고 불안정할 수 있음을 시사한다.
- 시뮬레이션 및 ABCD 연구 결과는 MRP-INT가 후편제어 외에도 보조 정보를 활용해 결과 모델 예측 성능을 향상시킴으로써 하위군 추정치의 편향을 줄임을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.