Skip to main content
QUICK REVIEW

[논문 리뷰] Adjusted Logistic Propensity Weighting Methods for Population Inference using Nonprobability Volunteer-Based Epidemiologic Cohorts

Lingxiao Wang, Richard Valliant|arXiv (Cornell University)|2020. 07. 06.
Statistical Methods and Bayesian Inference참고 문헌 17인용 수 4
한 줄 요약

이 논문은 조정된 로지스틱 참여도 가중치(Adjusted Logistic Propensity Weighting, ALP) 방법을 제안하여 비확률적, 자원봉사 기반 역학 코hort에서 인구 수준의 추론을 가능하게 한다. 이 방법은 보조 공변량을 기반으로 한 로지스틱 회귀를 통해 참가율을 추정하고 조정된 가중치를 사용한다. 이는 기존의 역참여도 점수 가중치(IPS) 기법보다 추정기의 편향과 효율성을 향상시키며, 모든 변동성 원인을 고려한 테일러 선형화 분산 추정을 적용한다. 시뮬레이션과 NHANES III 및 NHIS 데이터를 활용한 실제 데이터 응용에서 이 방법은 뛰어난 성능을 보였다.

ABSTRACT

Many epidemiologic studies forgo probability sampling and turn to nonprobability volunteer-based samples because of cost, response burden, and invasiveness of biological samples. However, finite population inference is difficult to make from the nonprobability samples due to the lack of population representativeness. Aiming for making inferences at the population level using nonprobability samples, various inverse propensity score weighting (IPSW) methods have been studied with the propensity defined by the participation rate of population units in the nonprobability sample. In this paper, we propose an adjusted logistic propensity weighting (ALP) method to estimate the participation rates for nonprobability sample units. Compared to existing IPSW methods, the proposed ALP method is easy to implement by ready-to-use software while producing approximately unbiased estimators for population quantities regardless of the nonprobability sample rate. The efficiency of the ALP estimator can be further improved by scaling the survey sample weights in propensity estimation. Taylor linearization variance estimators are proposed for ALP estimators of finite population means that account for all sources of variability. The proposed ALP methods are evaluated numerically via simulation studies and empirically using the naïve unweighted National Health and Nutrition Examination Survey III sample, while taking the 1997 National Health Interview Survey as the reference, to estimate the 15-year mortality rates.

연구 동기 및 목표

  • 비확률적, 자원봉사 기반 역학 코hort에서 대표성이 부족하여 유한 인구 추론을 수행하는 데 어려움이 존재하는 문제를 해결하기 위해.
  • 확률 샘플링이 불가능한 상황에서 비편향의 인구 추정을 줄일 수 있는 실용적이고 효율적인 가중치 방법을 개발하기 위해.
  • 기존의 역참여도 점수 가중치(IPS) 기법을 개선하기 위해 조정된 가중치와 효율성 향상을 위한 스케일링을 통합하기 위해.
  • 유한 인구 평균의 ALP 추정기에서 발생하는 모든 변동성 원인을 고려한 분산 추정 프레임워크를 제공하기 위해.

제안 방법

  • 보조 공변량을 기반으로 한 로지스틱 회귀를 사용해 참가 확률을 모델링하는 조정된 로지스틱 참여도 가중치(ALLP) 방법을 제안한다.
  • 참여도 모델에서 조사 표본 가중치를 조정하여 추정기의 효율성을 향상시키고 편향을 줄인다.
  • 테일러 선형화를 적용하여 ALP 추정기의 분산 추정기를 유도하며, 표본 추출 및 가중치 변동성 모두를 고려한다.
  • 이중 단계 접근법을 사용한다: 먼저 스케일링된 가중치를 사용한 로지스틱 회귀로 참여도 점수를 추정하고, 그 다음에 역참여도 가중치를 인구 추정기에 적용한다.
  • 실제 역학 연구에서 쉽게 사용할 수 있도록 실용적인 소프트웨어를 활용하여 구현 가능성을 확보한다.
  • 시뮬레이션 연구와 NHANES III를 비확률 표본으로, NHIS 1997을 기준 인구로 사용한 실증 분석을 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1비확률적 자원봉사 기반 표본을 사용할 때 조정된 로지스틱 참여도 가중치가 인구 평균에 대해 근사적으로 편향이 없는 추정기를 생성할 수 있는가?
  • RQ2다양한 비확률 표본 비율 하에서 ALP 추정기의 효율성은 기존의 IPSW 기법과 비교해 어떻게 다른가?
  • RQ3참여도 모델에서 조사 가중치를 스케일링하면 추정기의 정밀도 향상과 편향 감소에 얼마나 기여하는가?
  • RQ4테일러 선형화 분산 추정기는 ALP 추정치의 총 표본 변동성(표본 추출 및 가중치 불확실성 포함)을 얼마나 잘 반영하는가?
  • RQ5실제 비확률 데이터를 사용할 때 ALP 방법은 15년 간의 사망률과 같은 인구 수준의 결과를 신뢰성 있게 추정할 수 있는가?

주요 결과

  • ALP 방법은 비확률 표본 비율에 관계없이 인구 평균에 대해 근사적으로 편향이 없는 추정기를 생성하며, 표준 IPSW 기법보다 뛰어난 성능을 보였다.
  • 참여도 모델에서 조사 표본 가중치를 스케일링하면 ALP 추정기의 효율성이 크게 향상된다.
  • ALP 추정기의 테일러 선형화 분산 추정기는 표본 추출 및 가중치 불확실성과 같은 모든 변동성 원인을 효과적으로 반영한다.
  • 시뮬레이션 연구를 통해 ALP는 다양한 데이터 생성 메커니즘과 표본 크기 하에서도 강건한 성능을 보였다.
  • NHANES III와 NHIS 1997를 사용한 실증 응용 분석에서 ALP는 15년 간의 사망률 추정치를 신뢰성 있게 도출하여 실제 적용 가능성의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.