Skip to main content
QUICK REVIEW

[논문 리뷰] Statistical Matching using Fractional Imputation

Jaekwang Kim, Emily Berg|arXiv (Cornell University)|2015. 10. 13.
Survey Sampling and Estimation Techniques참고 문헌 20인용 수 4
한 줄 요약

이 논문은 조건부 독립 가정을 생략하고, 도구 변수 가정 하에 비모수적 분수형 보정을 사용하는 새로운 통계적 매칭 접근법을 제안한다. 분수형 가중치를 활용해 누락된 변수의 결합분포를 추정함으로써, 데이터 융합 및 측정 오차 모델에서 타당한 추론을 가능하게 하며, 일致한 분산 추정량을 제공한다.

ABSTRACT

Statistical matching is a technique for integrating two or more data sets when information available for matching records for individual participants across data sets is incomplete. Statistical matching can be viewed as a missing data problem where a researcher wants to perform a joint analysis of variables that are never jointly observed. A conditional independence assumption is often used to create imputed data for statistical matching. We consider an alternative approach to statistical matching without using the conditional independence assumption. We apply parametric fractional imputation of Kim (2011) to create imputed data using an instrumental variable assumption to identify the joint distribution. We also present variance estimators appropriate for the imputation procedure. We explain how the method applies directly to the analysis of data from split questionnaire designs and measurement error models.

연구 동기 및 목표

  • 기존 통계적 매칭 기법이 조건부 독립 가정에 의존하는 데서 비롯되는 한계를 해결하기 위해.
  • 누락된 변수의 결합분포를 특정하기 위해 도구 변수 가정을 활용하는 통계적 매칭 방법을 개발하기 위해.
  • 이mputed 데이터에서 추론을 위한 일致한 분산 추정량을 제공하여 타당한 통계적 추론을 보장하기 위해.
  • 분할 설문지 설계 및 측정 오차 모델과 같은 실용적 응용으로 방법을 확장하기 위해.
  • 동일한 표본에서 동시에 관측되지 않은 변수들을 공동으로 분석할 수 있도록 설문 조사 연구에서의 데이터 통합을 향상시키기 위해.

제안 방법

  • 김(2011)이 제안한 비모수적 분수형 보정을 적용하여, 분수형 가중치를 사용해 누락된 변수에 대한 다수의 보정된 값을 생성한다.
  • 조건부 독립 가정 없이 $y_1 \perp y_2 \mid x$ 를 가정하지 않고, 도구 변수 $x$ 와 관측된 $y_2$ 를 이용해 샘플 B의 $y_1$ 을 보정한다.
  • 모수를 추정하기 위해 $S_1(\theta_1)$ 과 $S_2(\theta_2)$ 라는 추정 함수를 사용하는 추정 방정식을 적용하며, $\theta = (\theta_1, \theta_2)$ 로 정의된다.
  • 스코어 기반 접근법을 통해 분산 추정량을 유도하며, 보정 및 추정의 변동성을 모두 고려한다.
  • 추정 함수의 분포를 근사하기 위해 타일러 전개를 활용하고, 분산-공분산 행렬을 유도한다.
  • 모수 $\theta_2$ 를 검정하기 위한 스코어 검정을 구성하며, 추정된 추정 함수의 분산을 기반으로 한 검정 통계량을 사용한다.

실험 결과

연구 질문

  • RQ1조건부 독립 가정에 의존하지 않고 통계적 매칭을 수행할 수 있는가?
  • RQ2도구 변수 가정을 어떻게 활용하여 통계적 매칭에서 누락된 변수의 결합분포를 특정할 수 있는가?
  • RQ3분수형 보정 기반 통계적 매칭에서 추론을 위한 적절한 분산 추정량은 무엇인가?
  • RQ4제안된 방법은 분할 설문지 설계 및 측정 오차 모델에서 어떻게 성능을 발휘하는가?
  • RQ5이mputed 데이터 프레임워크에서 모수를 검정하기 위한 타당한 스코어 검정을 구성할 수 있는가?

주요 결과

  • 제안된 방법은 도구 변수를 활용해 조건부 독립 가정의 엄격한 제약을 피함으로써 $y_1$ 과 $y_2$ 의 결합분포를 특정한다.
  • 보정 및 추정 불확실성을 모두 반영한 일치한 분산 추정량을 제공하여 타당한 추론을 가능하게 한다.
  • 시뮬레이션 연구 결과, 조건부 독립 가정이 위반될 경우에도 편향과 신뢰구간 커버리지 측면에서 우수한 성능을 보였다.
  • 추정 함수 기반 스코어 검정은 유한 표본에서 적절한 제1종 오류 비율과 양호한 검정력(유의도)을 보였다.
  • 이 방법은 서로 다른 변수들이 동일한 인구집단의 서로 다른 부분집단에서 수집되는 분할 설문지 설계에 직접 적용 가능하다.
  • 측정 오차 모델로의 확장도 자연스럽게 이루어지며, 보조 정보를 활용해 예측 변수의 오차를 보정하는 데 목적이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.