[論文レビュー] Data Integration by combining big data and survey sample data for finite population inference
本稿では、欠損がランダム(MAR)であるという仮定に依存せずに、有限母集団推論を可能にするデータ統合手法を提案する。ビッグデータを測定誤差を伴う有限母集団として扱い、補正重み付けと非パラメトリック分類を用いて選択バイアスおよび誤分類を是正することで、一般の選択メカニズム下でも一貫した推定が達成される。
The statistical challenges in using big data for making valid statistical inference in the finite population have been well documented in literature. These challenges are due primarily to statistical bias arising from under-coverage in the big data source to represent the population of interest and measurement errors in the variables available in the data set. By stratifying the population into a big data stratum and a missing data stratum, we can estimate the missing data stratum by using a fully responding probability sample, and hence the population as a whole by using a data integration estimator. By expressing the data integration estimator as a regression estimator, we can handle measurement errors in the variables in big data and also in the probability sample. We also propose a fully nonparametric classification method for identifying the overlapping units and develop a bias-corrected data integration estimator under misclassification errors. Finally, we develop a two-step regression data integration estimator to deal with measurement errors in the probability sample. An advantage of the approach advocated in this paper is that we do not have to make unrealistic missing-at-random assumptions for the methods to work. The proposed method is applied to the real data example using 2015-16 Australian Agricultural Census data.
研究の動機と目的
- 有限母集団のパラメータ推定において、ビッグデータソースに起因する選択バイアスおよび測定誤差に対処すること。
- 既存の重み付けおよび補完手法で一般的に用いられる欠損がランダム(MAR)という仮定の制限を克服すること。
- 完全に応答する確率標本を活用して欠損データの層を推定し、全体の有限母集団に対する推論を改善するデータ統合フレームワークを開発すること。
- 回帰ベースの補正と二段階推定を用いて、ビッグデータおよび調査標本の両方の変数における測定誤差を処理すること。
- 正確なマッチングが不可能な状況において、ビッグデータと調査標本の重複単位を特定する非パラメトリック分類法を提供すること。
提案手法
- 有限母集団を、カバレッジと測定誤差を伴うビッグデータ層と、確率標本によって推定される欠損データ層に層別化する。
- 測定誤差の是正を図るため、データ統合推定量を回帰推定量として表現する。
- 重複単位を特定するための半教師あり非パラメトリック分類法を用いて、傾向スコアを推定する。
- 重複単位特定プロセスにおける誤分類誤差を考慮したバイアス補正済みデータ統合推定量を提案する。
- 測定誤差が確率標本に存在する場合の効率性とロバストネスを向上させるため、二段階回帰推定量を開発する。
- ビッグデータソースからの補助情報に基づく補正重み付けを適用し、推定の効率性を向上させるとともにバイアスを低減する。
実験結果
リサーチクエスチョン
- RQ1ビッグデータソースにカバレッジ不足と測定誤差が生じる状況において、どのように有効な有限母集団推論を実現できるか?
- RQ2選択バイアス補正に欠損がランダム(MAR)仮定に依存しないデータ統合手法を開発できるか?
- RQ3正確なマッチングが不可能な状況で、ビッグデータと調査標本の重複単位を効果的に特定する方法は何か?
- RQ4統一されたデータ統合フレームワーク内で、ビッグデータおよび調査標本の両方における測定誤差をどのように是正できるか?
- RQ5重複単位特定における誤分類が、得られる推定量のバイアスおよび分散に与える影響は何か?
主な発見
- 提案手法は、実務において検証が困難なMAR仮定を必要とせず、一般の選択メカニズム下でも一貫した推定を達成する。
- 非パラメトリック分類法は、正確なマッチングが不可能な状況でも、ビッグデータと調査標本の重複単位を効果的に特定する。
- バイアス補正済みデータ統合推定量は、重複単位特定における誤分類によるバイアスを効果的に低減する。
- 二段階回帰推定量は、確率標本に測定誤差が存在する場合でも、効率性とロバストネスを向上させる。
- 分散推定はテイラー線形化および補正ベースの設計ベース推論を用い、マス補完および補正ベース推定量の両方に対して一貫した分散推定量が導出された。
- 2015-16年オーストラリア農業センサスデータへの応用により、本手法の公式統計作成における実用的有用性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。