Skip to main content
QUICK REVIEW

[論文レビュー] Integration of survey data and big observational data for finite population inference using mass imputation

Shu Yang, Jae Kwang Kim|arXiv (Cornell University)|Jul 8, 2018
Statistical Methods and Bayesian Inference参考文献 24被引用数 12
ひとこと要約

本稿では、確率的調査データと大規模な観察データ(ビッグデータ)を統合して有限母集団推論を改善する非パラメトリックな質量補完フレームワークを提案する。ビッグデータをトレーニングデータセットとして用い、全調査サンプルの欠損している研究変数を補完することで、強いパラメトリック仮定を必要とせず、ロバストで効率的な推定量を達成する。モデルの誤指定や選択バイアスが生じる状況下でも、シミュレーション研究において他の手法を上回る性能を示す。

ABSTRACT

Multiple data sources are becoming increasingly available for statistical analyses in the era of big data. As an important example in finite-population inference, we consider an imputation approach to combining a probability sample with big observational data. Unlike the usual imputation for missing data analysis, we create imputed values for the whole elements in the probability sample. Such mass imputation is attractive in the context of survey data integration (Kim and Rao, 2012). We extend mass imputation as a tool for data integration of survey data and big non-survey data. The mass imputation methods and their statistical properties are presented. The matching estimator of Rivers (2007) is also covered as a special case. Variance estimation with mass-imputed data is discussed. The simulation results demonstrate the proposed estimators outperform existing competitors in terms of robustness and efficiency.

研究の動機と目的

  • 確率的調査データと、潜在的にバイアスを含む大規模なビッグデータソースを統合して有限母集団推論を実現する課題に対処すること。
  • 従来の補完手法の限界を克服するため、全調査サンプルを補完すべき欠損データとみなして、ビッグデータをトレーニングデータセットとして用いること。
  • 既存手法で一般的な強いモデル仮定を避ける、設計ベースの非パラメトリックな質量補完フレームワークを構築すること。
  • 調査サンプルの代表性とビッグデータの予測力の両方を活用して、推定の効率性とロバスト性を向上させること。
  • 質量補完推定量のための厳密な漸近理論と分散推定法を提供すること。これには、補正重み付けと非パラメトリック補完戦略が含まれる。

提案手法

  • ビッグオブザーバショナルデータをトレーニングデータセットとして用い、質量補完により確率的サンプルの全ユニットの欠損研究変数を予測する。
  • 非パラメトリック補完手法を実装する:最近傍補完(NNI)、k-最近傍補完(kNNI)、一般化加法モデル(GAM)。
  • 設計ベース推論を用い、モデル仮定に依存しない効率性の向上を図る、新しい補正重み付け推定量を提案する。
  • 質量補完データに対してホルヴィッツ=トムプソン型推定を適用し、補完の不確実性を反映した分散推定を実施する。
  • ビッグデータのサンプリング機構が欠損がランダム(MAR)であると仮定した場合に理論的妥当性を保証する。ルービンのフレームワークを用いる。
  • 異質性の処理とモデル誤指定に対するロバストネスの向上を図るため、統合されたフレームワーク内で複数の補完戦略を統合する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして質量補完を形式化することで、ビッグオブザーバショナルデータと確率的調査サンプルを統合し、有限母集団推論を実現できるか?
  • RQ2非パラメトリック補完手法(例:kNNI、GAM)は、モデル誤指定下で、パラメトリック代替手法よりもよりロバストで効率的な推定量をもたらすか?
  • RQ3補正重み付けは、パラメトリックモデルに依存しないで、質量補完データに適応可能か?
  • RQ4選択バイアスやモデル誤指定下で、質量補完の性能は、既存手法(例:IPW、DR)と比較してどうなるか?
  • RQ5設計ベースフレームワークにおける質量補完推定量の漸近的性質と分散推定戦略は何か?

主な発見

  • 特にkNNIとGAMを用いた提案された質量補完手法は、モデル誤指定下でも、他の既存手法に比べて顕著にロバスト性と効率性に優れている。
  • 補正重み付け推定量は、結果変数やプロパティスモデルが誤指定されても、他の手法よりも高い効率性を達成し、ロバスト性を維持している。
  • 最近傍補完(NNI)およびkNNIは、あらゆるシナリオにおいてバイアスが0.1×10²未満で安定し、カバレッジ率は96%前後を維持している。
  • ビッグデータへの所属関係が全調査ユニットで把握されている場合、回帰補正推定量は高い効率性(S.E. ~3.7×10²)と良好なカバレッジ(95.8–96.6%)を維持している。
  • IPW推定量はモデル誤指定に対して極めて感受性が高く、非線形プロパティスモデル下ではカバレッジが1.8%に低下する一方、DR推定量は改善されたロバストネスを示している。
  • 米国国勢調査の実データに基づくシミュレーション結果から、非パラメトリックモデルを用いた質量補完は、ビッグデータのサンプリングが無視できない(非-MAR)状況下でも、バイアスが低く、カバレッジが高く維持される。ただし、MAR仮定が成立していることが条件である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。