[論文レビュー] An Interval Estimation Approach to Sample Selection Bias
本稿では、標本選択バイアス下での母数パラメータの計算的に効率的な区間推定法を提案する。確率的プログラミングを用いて、選択メカニズムに関する強い仮定を必要としない有効な信頼区間を導出する。共通の補助データ(応答率や共変量の平均など)を統合することで区間の精度を向上させ、シミュレーションおよび英国バイオバンクにおける教育が収入に与える影響に関する実世界の研究で、強固な性能を示している。
A widespread and largely unaddressed challenge in statistics is that non-random participation in study samples can bias the estimation of parameters of interest. To address this problem, we propose a computationally efficient interval estimator for a class of population parameters encompassing population means, ordinary least squares and instrumental variables estimands which makes minimal assumptions about the selection mechanism. Using results from stochastic programming, we derive valid confidence intervals and hypothesis tests based on this estimator. In addition, we demonstrate how to tighten the intervals by incorporating additional constraints based on population-level information commonly available to researchers, such as survey response rates and covariate means. We conduct a comprehensive simulation study to evaluate the finite sample performance of our estimator and conclude with a real data study on the causal effect of education on income in the highly-selected UK Biobank cohort. We are able to demonstrate that our method can produce informative bounds under relatively few population-level auxiliary constraints.
研究の動機と目的
- 非確率的参加によってパラメータ推定値が歪むという統計的推定における広範な問題に対処すること。
- 母平均、OLS、IV推定量を含む広いクラスのパラメータに適用可能な計算的に効率的な区間推定法を開発すること。
- 選択メカニズムに関する強い仮定を必要とせず、確率的プログラミングを用いて有効な信頼区間および仮説検定を導出すること。
- 共通の母集団レベルの補助情報(例えば調査の応答率や共変量の平均)を統合することで、区間の精度を向上させること。
- シミュレーションおよび教育と収入に関する因果推論の実世界研究を通じて、有限標本における性能と実用的有用性を示すこと。
提案手法
- 選択メカニズムの不確実性をモデル化するため、区間推定問題を確率的プログラミングを用いて定式化する。
- 非確率的標本調査に起因するバイアスを制限する凸最適化問題を解くことで、関心パラメータの信頼区間を構築する。
- 選択プロセスに関する構造的仮定を最小限に抑え、選択インジケータの存在と観測された結果の存在にのみ依存する。
- 既知の母集団レベルの応答率や共変量の平均といった補助制約を最適化フレームワークに統合し、区間の境界をきつくする。
- 得られた区間推定法に基づいて、有効な統計的推論(信頼区間および仮説検定)を導出する。
- シミュレートされたデータおよび英国バイオバンクの実世界データに本手法を適用し、現実的な条件下での性能を評価する。
実験結果
リサーチクエスチョン
- RQ1選択メカニズムに関する強い仮定を必要とせず、計算的に効率的な区間推定法を、標本選択バイアス下の母数パラメータに対して開発可能か?
- RQ2既知の調査の応答率や共変量の平均といった補助制約は、得られる信頼区間の精度にどのように影響するか?
- RQ3本手法の有限標本における性能は、現実的なシミュレーション設定でどのように評価できるか?
- RQ4教育と収入に関する因果推論において、UK Biobankのような著しい選択バイアスを示す実世界のコhortにおいて、本手法は情報的な境界を提供できるか?
主な発見
- 提案された区間推定法は、選択メカニズムに関する最小限の仮定のもとで有効な信頼区間を生成し、統計的妥当性を保証する。
- 応答率や共変量の平均といった補助制約を統合することで、区間の境界が著しくきつくなり、最小限のデータ要件で精度が向上する。
- シミュレーションにおいて、多様な選択メカニズムの下で、有限標本における性能が強く、名目水準に近いカバレッジ率を維持する。
- UK Biobankへの応用において、コホートの著しい選択バイアスにもかかわらず、教育が収入に与える因果効果の情報的な境界を生成した。
- 計算的に効率的かつスケーラブルなため、選択バイアスを伴う観察的研究における実用的応用が可能である。
- 測定されていない交絡要因や選択バイアスが懸念される状況においても、有効な統計的推論を伴う境界推定を提供するため、ロバストな因果推論が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。