[論文レビュー] Double Robust Semi-Supervised Inference for the Mean: Selection Bias under MAR Labeling with Decaying Overlap
本稿では、標本が欠損する場合(MAR)で重複度が減少する状況下において、ラベル付きデータが少ない中で、共変量に依存するラベリングによる選択バイアスが生じる状況における平均推定のための二重ロバスト半教師あり(DRSS)推定量を提案する。この手法は、結果の回帰モデルまたは感受性スコアモデルのいずれかが正しく指定されていれば一貫性を保証し、ラベル付きサンプルサイズが小さい場合に依存する非標準的な漸近的収束速度を達成する。これにより、モデル誤指定や不均衡データに対しても有効な推論が可能になる。
Semi-supervised (SS) inference has received much attention in recent years. Apart from a moderate-sized labeled data, L, the SS setting is characterized by an additional, much larger sized, unlabeled data, U. The setting of |U| >> |L|, makes SS inference unique and different from the standard missing data problems, owing to natural violation of the so-called "positivity" or "overlap" assumption. However, most of the SS literature implicitly assumes L and U to be equally distributed, i.e., no selection bias in the labeling. Inferential challenges in missing at random (MAR) type labeling allowing for selection bias, are inevitably exacerbated by the decaying nature of the propensity score (PS). We address this gap for a prototype problem, the estimation of the response's mean. We propose a double robust SS (DRSS) mean estimator and give a complete characterization of its asymptotic properties. The proposed estimator is consistent as long as either the outcome or the PS model is correctly specified. When both models are correctly specified, we provide inference results with a non-standard consistency rate that depends on the smaller size |L|. The results are also extended to causal inference with imbalanced treatment groups. Further, we provide several novel choices of models and estimators of the decaying PS, including a novel offset logistic model and a stratified labeling model. We present their properties under both high and low dimensional settings. These may be of independent interest. Lastly, we present extensive simulations and also a real data application.
研究の動機と目的
- ラベル付きデータが少なく、共変量に依存するラベリングによってラベル付き/ラベルなしの分布が異なる状況における半教師あり推論における選択バイアスを解消すること。
- 結果の回帰モデルまたは感受性スコアモデルのいずれかが正しく指定されていれば一貫性を保証する二重ロバスト推定量を開発すること。
- 感受性スコアがサンプルサイズの増加に伴いゼロに近づく「重複度の減少」の下での推定量の漸近的性質を同定すること。
- 不均衡な治療群を伴う因果推論へのフレームワークの拡張。
- 高次元および低次元の設定下で、オフセットロジスティックモデルと階層化ラベリングモデルを含む、重複度が減少する感受性スコアのための新しいモデルを提案すること。
提案手法
- ラベル付きおよびラベルなしデータを両方活用し、逆確率重み付けと結果の回帰を組み合わせた、二重ロバスト半教師あり(DRSS)推定量を提案する。
- 大規模なラベルなしサンプルにおけるラベリング確率の低下を扱えるように、新しいオフセットロジスティックモデルを用いて減少する感受性スコアを推定する。
- サブグループ間でラベリングメカニズムが異なっている状況に対応するため、階層化ラベリングモデルを適用する。
- DRSS構造と重複度の減少が引き起こす複雑な依存性を考慮するため、ジャックナイフ型の分散推定量を用いる。
- 弱い正則性条件の下で漸近正規性と一貫性を導出し、両モデルが正しく指定されている場合の収束速度はラベル付きサンプルサイズに依存する。
- 高次元設定下での過剰適合を回避し、二重ロバスト性を確保するため、K分割によるクロスフィット手順を用いる。
実験結果
リサーチクエスチョン
- RQ1MARラベリングと重複度の減少を伴う半教師あり設定において、二重ロバスト推定量は平均推定において一貫性と有効性を保つことができるか?
- RQ2感受性スコアがサンプルサイズの増加に伴いゼロに近づく場合、DRSS推定量の漸近的分布と収束速度は何か?
- RQ3結果の回帰モデルまたは感受性スコアモデルのいずれかにモデル誤指定が生じた場合、DRSS推定量の有限サンプル性能にどのような影響が生じるか?
- RQ4提案されたオフセットロジスティックモデルは、高次元設定下でも減少する感受性スコアを効果的に推定できるか?
- RQ5同様の選択バイアス条件下で、不均衡な治療群を伴う因果推論へのDRSSフレームワークの拡張は可能か?
主な発見
- 結果の回帰モデルまたは感受性スコアモデルのいずれかが正しく指定されていれば、DRSS推定量は一貫性を保証し、モデル誤指定に対してロバストである。
- 両モデルが正しく指定されている場合、推定量は非標準的な漸近的分散を達成し、これは全サンプルサイズではなくラベル付きサンプルサイズに依存する。
- 漸近的分布は正規分布であり、分散は $ O((n \bar{\pi}_N)^{-1}) $ のスケーリングに従う。ここで $ n $ はラベル付きサンプルサイズ、$ \bar{\pi}_N $ は平均感受性スコアである。
- 感受性スコアの推定に用いられたオフセットロジスティックモデルは、重複度の減少下でも一貫性を保ち、シミュレーション研究では標準的ロジスティック回帰を上回る性能を示した。
- 階層化ラベリングモデルは、サブグループ間でラベリングメカニズムが異なる状況での推定効率を向上させる。
- 実験的結果から、DRSS推定量は有限サンプルでも有効なカバレッジを維持し、選択バイアス下で標準的教師ありおよび半教師あり推定量を凌駆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。