Skip to main content
QUICK REVIEW

[논문 리뷰] Semiparametric Estimation with Data Missing Not at Random Using an Instrumental Variable

Baoluo Sun, Lan Liu|arXiv (Cornell University)|2016. 07. 11.
Statistical Methods and Inference참고 문헌 37인용 수 13
한 줄 요약

이 논문은 비모수적 식별 및 누락되지 않음(Nonignorable Missingness, MNAR) 데이터 하에서 인구 평균을 추정하기 위한 반모수적 프레임워크를 제안한다. 인용자 변수(Instrumental Variable, IV)를 사용하여, 선형 회귀 모형이 아닌 조건 하에서 누락되지 않음 데이터에서의 비모수적 식별과 추정을 가능하게 한다. 이 논문은 비모수적 추정의 일관성을 보장하는 이중적으로 강건한( doubly robust) 추정기법을 개발하였으며, 이는 확률 가중치의 역수와 결과 회귀 모형을 조합하여, 적절한 성향 스코어 또는 결과 모형 중 하나만 올바르게 특정되어도 일관성 있는 추정을 보장한다. 이 방법은 보츠와나에서의 HIV 혈액형 유병률 연구에 적용되었으며, 인터뷰어의 특성(성별, 연령, 경력 등)을 인용자 변수로 사용하였다.

ABSTRACT

Missing data occur frequently in empirical studies in health and social sciences, often compromising our ability to make accurate inferences. An outcome is said to be missing not at random (MNAR) if, conditional on the observed variables, the missing data mechanism still depends on the unobserved outcome. In such settings, identification is generally not possible without imposing additional assumptions. Identification is sometimes possible, however, if an instrumental variable (IV) is observed for all subjects which satisfies the exclusion restriction that the IV affects the missingness process without directly influencing the outcome. In this paper, we provide necessary and sufficient conditions for nonparametric identification of the full data distribution under MNAR with the aid of an IV. In addition, we give sufficient identification conditions that are more straightforward to verify in practice. For inference, we focus on estimation of a population outcome mean, for which we develop a suite of semiparametric estimators that extend methods previously developed for data missing at random. Specifically, we propose inverse probability weighted estimation, outcome regression-based estimation and doubly robust estimation of the mean of an outcome subject to MNAR. For illustration, the methods are used to account for selection bias induced by HIV testing refusal in the evaluation of HIV seroprevalence in Mochudi, Botswana, using interviewer characteristics such as gender, age and years of experience as IVs.

연구 동기 및 목표

  • 결과가 누락되지 않음(MNAR)인 경우에 발생하는 선택 편향을 다루기 위한 목적이며, 이는 헬스 및 사회과학 분야에서 흔한 과제이다.
  • 외부 조건(Exclusion restriction)과 관련성 조건을 만족하는 인용자 변수를 사용하여, MNAR 하에서 전체 데이터 분포의 비모수적 식별을 제공한다.
  • 비모수적 추정기법을 사용하여, 누락되지 않음에 의해 영향을 받는 결과의 인구 평균을 추정하는 이중적으로 강건한 추정기법을 개발함으로써, 모형 오특정에 대한 강건성을 향상시킨다.
  • 실제 적용 사례를 통해 방법의 실용적 유용성을 입증하기 위해, 보츠와나의 모추디(Mochudi) 지역에서의 HIV 혈액형 유병률 연구에 적용하였다. 여기서 검사 거부로 인해 MNAR가 발생하였다.
  • 기존의 누락되지 않음(MAR) 기반 방법을 더 약한 모형 가정 하에 인용자 변수를 활용하여 MNAR를 다룰 수 있도록 확장한다.

제안 방법

  • 외부 조건과 관련성 조건을 만족하는 인용자 변수를 사용하여, MNAR 하에서 전체 데이터 분포의 비모수적 식별을 위한 필요 및 충분 조건을 제안한다.
  • 확률 가중치의 역수와 결과 회귀 모형을 조합하여, 결과 평균을 추정하는 이중적으로 강건한 추정기법을 개발하였으며, 이는 성향 스코어 또는 결과 모형 중 하나만 올바르게 특정되어도 일관성 있는 추정을 보장한다.
  • 추정 방정식을 사용하여 결과, 누락 여부, 인용자 변수의 결합 분포를 추정하며, 성향 스코어 모형과 결과 회귀 모형을 모두 통합한다.
  • 이중 단계 추정 절차를 사용한다: 첫 번째 단계에서는 공변수 조건 하에서 인용자 변수의 조건부 분포를 추정하고, 두 번째 단계에서는 결과 모형과 선택 편향 함수를 추정한다.
  • 실제 데이터를 사용하여 보츠와나의 연구에 적용하였으며, 인터뷰어의 성별, 연령, 경력 등을 인용자 변수로 사용하여 HIV 검사에서의 비무시적 비응답(Non-ignorable non-response)에 기인한 선택 편향을 조정하였다.
  • 수치 최적화 및 근 구하기 알고리즘(예: uniroot)을 사용하여 선택 편향 매개변수를 추정하고, MNAR 하에서의 평균을 추정하였다.

실험 결과

연구 질문

  • RQ1데이터가 누락되지 않음(MNAR)이고 인용자 변수가 존재할 때, 어떤 조건에서 전체 데이터 분포를 비모수적으로 식별할 수 있는가?
  • RQ2성향 스코어 또는 결과 모형 중 하나만 올바르게 특정되어도 일관성 있는 추정이 보장되는, MNAR 하에서의 인구 평균을 위한 이중적으로 강건한 추정기법은 어떻게 구성할 수 있는가?
  • RQ3제안된 방법은 실생활의 건강 조사, 예를 들어 HIV 혈액형 유병률 연구에서 비무시적 비응답으로 인한 선택 편향을 효과적으로 조정할 수 있는가?
  • RQ4이론적으로 타당하고 실증 연구에서 검증 가능한 실용적인 식별 조건은 무엇인가?
  • RQ5제안된 추정기법의 성능은 MNAR 조건에서 기존의 완전사례 분석 또는 MAR 기반 방법과 비교하여 어떻게 다른가?

주요 결과

  • 이 논문은 인용자 변수를 사용하여 MNAR 하에서 전체 데이터 분포의 비모수적 식별을 위한 필수 및 충분 조건을 확립하였으며, 이는 원인 추론 분야의 기존 연구를 확장한다.
  • 성향 스코어 또는 결과 모형 중 하나만 올바르게 특정되어도 일관성 있는 추정이 보장되는, 결과 평균을 위한 새로운 이중적으로 강건한 추정기법을 제안하였다. 이는 모형 오특정에 대한 강건성을 향상시킨다.
  • 모추디 지역의 HIV 혈액형 유병률 연구에서, 검사 거부가 비무시적일 뿐만 아니라 인터뷰어의 특성과 연관되어 있어, 제안된 방법이 선택 편향을 효과적으로 조정하였다.
  • 시뮬레이션 및 실증 결과는, 데이터가 MNAR일 경우 완전사례 분석 및 기존의 MAR 기반 방법보다 제안된 추정기법이 더 우수한 성능을 보임을 보여주었다.
  • 완전히 비모수적 모형보다 더 약한 가정 하에 유효한 추론을 가능하게 하여, 모형 오특정에 대한 민감도를 감소시켰다.
  • 응용 분석 결과, 인터뷰어의 성별, 연령, 경력 등의 특성이 타당한 인용자 변수로 기능하며, MNAR 하에서의 식별과 추정을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.