Skip to main content
QUICK REVIEW

[논문 리뷰] Double Robust Semi-Supervised Inference for the Mean: Selection Bias under MAR Labeling with Decaying Overlap

Yuqian Zhang, Abhishek Chakrabortty|arXiv (Cornell University)|2021. 04. 14.
Advanced Causal Inference Techniques참고 문헌 39인용 수 4
한 줄 요약

이 논문은 라벨이 임의로 누락된(MAR) 상황에서 오버랩이 감소하는 조건 하에, 라벨이 부족하고 공변수에 따라 라벨이 부여되는 선택 편향이 발생하는 경우 평균을 추정하기 위한 더블 로버스트 반감독(드래프트) 추정량을 제안한다. 이 방법은 결과 모델 또는 성향 스코어 모델 둘 중 하나만 올바르게 특정되어 있더라도 일관성을 보장하며, 더 작은 라벨 데이터 샘플 크기에 따라 영향을 받는 비표준 점근적 수렴 속도를 달성하여, 모형 잘못 설정과 불균형한 데이터 조건 하에서도 타당한 추론이 가능하게 한다.

ABSTRACT

Semi-supervised (SS) inference has received much attention in recent years. Apart from a moderate-sized labeled data, L, the SS setting is characterized by an additional, much larger sized, unlabeled data, U. The setting of |U| >> |L|, makes SS inference unique and different from the standard missing data problems, owing to natural violation of the so-called "positivity" or "overlap" assumption. However, most of the SS literature implicitly assumes L and U to be equally distributed, i.e., no selection bias in the labeling. Inferential challenges in missing at random (MAR) type labeling allowing for selection bias, are inevitably exacerbated by the decaying nature of the propensity score (PS). We address this gap for a prototype problem, the estimation of the response's mean. We propose a double robust SS (DRSS) mean estimator and give a complete characterization of its asymptotic properties. The proposed estimator is consistent as long as either the outcome or the PS model is correctly specified. When both models are correctly specified, we provide inference results with a non-standard consistency rate that depends on the smaller size |L|. The results are also extended to causal inference with imbalanced treatment groups. Further, we provide several novel choices of models and estimators of the decaying PS, including a novel offset logistic model and a stratified labeling model. We present their properties under both high and low dimensional settings. These may be of independent interest. Lastly, we present extensive simulations and also a real data application.

연구 동기 및 목표

  • 라벨 데이터가 적고 공변수에 따라 라벨이 부여되는 조건에서 발생하는 선택 편향을 반감독 추론에서 다루기 위해.
  • 결과 회귀 모델 또는 성향 스코어 모델 둘 중 하나만 올바르게 특정되어 있어도 일관성을 유지하는 더블 로버스트 추정량을 개발하기 위해.
  • 성향 스코어가 표본 크기가 증가함에 따라 0으로 수렴하는 감소하는 오버랩 조건 하에서 추정량의 점근적 성질을 규명하기 위해.
  • 불균형한 치료 그룹이 존재하는 조건에서 인과 추론으로의 프레임워크 확장을 위해.
  • 고차원 및 저차원 설정 하에서 감소하는 성향 스코어를 위한 새로운 모델, 즉 오프셋 로지스틱 모델과 계층화된 라벨링 모델을 제안하기 위해.

제안 방법

  • 라벨된 데이터와 라벨되지 않은 데이터를 모두 활용하여, 역확률가중치화와 결과 회귀를 조합한 더블 로버스트 반감독(드래프트) 추정량을 제안한다.
  • 크기가 큰 라벨되지 않은 샘플에서 라벨 부여 확률이 감소하는 상황을 고려해, 감소하는 성향 스코어를 추정하기 위해 새로운 오프셋 로지스틱 모델을 사용한다.
  • 서브집단 간 이질적인 라벨링 메커니즘을 다루기 위해 계층화된 라벨링 모델을 적용한다.
  • 드래프트 구조와 감소하는 오버랩으로 인해 발생하는 복잡한 의존성에 대응하기 위해 재귀형 분산 추정량을 사용한다.
  • 약한 정규성 조건 하에서 점근 정규성과 일관성을 도출하며, 두 모델이 모두 올바를 경우 수렴 속도는 라벨된 샘플 크기에 따라 달라진다.
  • 고차원 설정에서 과적합을 방지하고 더블 로버스트성을 확보하기 위해 K-겹 분할을 사용한 크로스피팅 절차를 사용한다.

실험 결과

연구 질문

  • RQ1MAR 라벨링과 감소하는 오버랩 조건 하에서 반감독 설정에서 더블 로버스트 추정량이 평균 추정에 대해 일관성과 타당성을 유지할 수 있는가?
  • RQ2표본 크기가 증가함에 따라 성향 스코어가 0으로 수렴할 경우, DRSS 추정량의 점근적 분포와 수렴 속도는 어떻게 되는가?
  • RQ3결과 회귀 모델 또는 성향 스코어 모델 중 하나에서 모형 잘못 설정이 DRSS 추정량의 유한 표본 성능에 어떤 영향을 미치는가?
  • RQ4제안된 오프셋 로지스틱 모델이 고차원 설정에서 감소하는 성향 스코어를 효과적으로 추정할 수 있는가?
  • RQ5유사한 선택 편향 조건 하에서, DRSS 프레임워크는 불균형한 치료 그룹이 존재하는 인과 추론으로 어떻게 확장될 수 있는가?

주요 결과

  • 결과 회귀 모델 또는 성향 스코어 모델 둘 중 하나만 올바르게 특정되어 있어도 DRSS 추정량은 일관성을 보이며, 모형 잘못 설정에 대한 강건성을 확보한다.
  • 두 모델이 모두 올바르게 특정되어 있을 경우, 추정량은 전체 표본 크기보다는 라벨된 표본 크기에 따라 영향을 받는 비표준 점근적 분산을 달성한다.
  • 점근적 분포는 정규분포이며, 분산은 $ O((n \bar{\pi}_N)^{-1}) $ 비례로 스케일링되며, 여기서 $ n $ 은 라벨된 표본 크기이고 $ \bar{\pi}_N $ 는 평균 성향 스코어이다.
  • 감소하는 오버랩 조건 하에서도 성향 스코어를 일관되게 추정할 수 있는 제안된 오프셋 로지스틱 모델은 시뮬레이션 연구에서 표준 로지스틱 회귀보다 뛰어난 성능을 보였다.
  • 서브집단 간 라벨링 메커니즘이 이질적인 설정에서 계층화된 라벨링 모델은 추정 효율성을 향상시켰다.
  • 실증 결과는 DRSS 추정량이 표본 크기가 유한한 조건에서도 타당한 커버리지 유지하며, 선택 편향 하에서 표준 감독 및 반감독 추정량보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.