[論文レビュー] Doubly Robust Inference With Nonprobability Survey Samples
本稿では、確率的調査からの補助データを用いて、非確率的調査標本のための二重に頑健な推論フレームワークを提案する。選択確率スコアの推定と、逆確率重み付けと回帰補正を組み合わせることで、選択確率モデルまたは結果回帰モデルのいずれかが誤指定であっても、有限母集団平均の一致推定を保証する。シミュレーションおよび実データの検証により、より高い頑健性と効率性が示された。
We establish a general framework for statistical inferences with nonprobability survey samples when relevant auxiliary information is available from a probability survey sample. We develop a rigorous procedure for estimating the propensity scores for units in the nonprobability sample, and construct doubly robust estimators for the finite population mean. Variance estimation is discussed under the proposed framework. Results from simulation studies show the robustness and the efficiency of our proposed estimators as compared to existing methods. The proposed method is used to analyze a nonprobability survey sample collected by the Pew Research Center with auxiliary information from the Behavioral Risk Factor Surveillance System and the Current Population Survey. Our results illustrate a general approach to inference with nonprobability samples and highlight the importance and usefulness of auxiliary information from probability survey samples. Supplementary materials for this article are available online.
研究の動機と目的
- 非確率的調査標本からの妥当な統計的推論を実現する挑戦に取り組む。非確率的標本は包含確率が不明であり、選択バイアスの影響を受ける。
- 補助情報として参照用の確率的標本から得られるデータがある状況において、選択確率スコアを推定するための厳密なフレームワークを開発する。
- 選択確率スコアモデルまたは結果回帰モデルのいずれかが正しく指定されていれば一貫性を保つ有限母集団平均の二重に頑健な推定量を構築する。
- 提案されたフレームワーク下での妥当な分散推定手順を提供し、信頼性のある推論を可能にする。
提案手法
- 非確率的標本の単位の包含確率を推定するために、確率的調査からの補助データを活用する一般的なフレームワークを提案する。
- 2段階推定手順を開発する:まず、確率的標本の補助変数を用いたロジスティック回帰モデルにより選択確率スコアを推定する。
- 推定された選択確率スコアを用いて、結果の残差に対する逆確率重み付けと回帰補正を組み合わせることで、母集団平均の二重に頑健(DR)推定量を構築する。
- 補助標本の確率的標本設計下で設計的一致性を確保するため、モデルベース成分にハジェク型推定量を用いる。
- 標本抽出の変動とモデル推定の不確実性の両方を考慮した漸近的分散推定量を導出する。
- 実データとして、ピュー・リサーチ・センターの非確率的調査を、行動リスク因子監視システム(BRFSS)および現在の人口調査(CPS)からの補助データを用いて適用する。
実験結果
リサーチクエスチョン
- RQ1非確率的調査データのみが利用可能であるが、補助的に確率的標本からのデータが入手可能な状況において、有限母集団平均のための二重に頑健な推定量を構築できるか?
- RQ2確率的標本からの補助変数を用いて、非確率的標本の単位の選択確率スコアを信頼性高く推定する方法は何か?
- RQ3提案された二重に頑健な推定量は、選択確率スコアモデルまたは結果回帰モデルのいずれかが誤指定であっても一貫性を保つのか?
- RQ4バイアス、平均二乗誤差、信頼区間のカバレッジという観点から、有限標本における提案推定量の性能は、既存の手法と比べてどうか?
- RQ5提案されたフレームワーク下で、妥当な分散推定をどのように達成できるか?
主な発見
- 提案された二重に頑健な推定量は、選択確率スコアモデルまたは結果回帰モデルのいずれかが正しく指定されていれば、母集団平均の一貫性を達成する。これにより、モデル誤指定に対する頑健性が保証される。
- シミュレーション研究では、結果回帰モデルが正しく指定されている場合に、提案推定量が既存の手法よりも低い平均二乗誤差とより良好なカバレッジ率を示した。
- 選択確率スコアモデルが誤指定であっても、推定量は良好な性能を維持し、二重に頑健な性質の価値を示した。
- 提案されたフレームワーク下での分散推定は妥当であり、標本抽出設計とモデル推定の不確実性の両方を考慮しており、正確な信頼区間の構築を可能にする。
- BRFSとCPSからの補助データを用いてピュー・リサーチ・センターの非確率的調査に適用した結果、母集団平均の妥当で効率的な推定値が得られた。
- 結果は、確率的標本からの補助データが非確率的調査からの信頼できる推論を可能にする上で極めて重要な役割を果たすことを強調している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。