Skip to main content
QUICK REVIEW

[論文レビュー] Maximum sampled conditional likelihood for informative subsampling

HaiYing Wang, Jae Kwang Kim|arXiv (Cornell University)|Nov 11, 2020
Distributed Sensor Networks and Detection Algorithms参考文献 31被引用数 10
ひとこと要約

本稿は、実現された標本抽出確率を用いることで推定効率を向上させる、大規模データにおける情報的標本抽出のための最大標本条件付き尤度推定量(MSCLE)を提案する。MSCLEが不偏推定量の中で最小の漸近的分散を達成することを証明し、特にパイLOTの誤指定下でも理論的・実用的両面で逆確率重み付け(IPW)を上回ることを示す。

ABSTRACT

Subsampling is a computationally effective approach to extract information from massive data sets when computing resources are limited. After a subsample is taken from the full data, most available methods use an inverse probability weighted (IPW) objective function to estimate the model parameters. The IPW estimator does not fully utilize the information in the selected subsample. In this paper, we propose to use the maximum sampled conditional likelihood estimator (MSCLE) based on the sampled data. We established the asymptotic normality of the MSCLE and prove that its asymptotic variance covariance matrix is the smallest among a class of asymptotically unbiased estimators, including the IPW estimator. We further discuss the asymptotic results with the L-optimal subsampling probabilities and illustrate the estimation procedure with generalized linear models. Numerical experiments are provided to evaluate the practical performance of the proposed method.

研究の動機と目的

  • 選択確率が説明変数と応答変数の両方に依存する情報的標本抽出における逆確率重み付け(IPW)の非効率性を是正すること。
  • 重み付けに依存するのではなく、選択された標本に含まれる情報を完全に活用する尤度ベースの推定量を構築すること。
  • 提案された最大標本条件付き尤度推定量(MSCLE)の漸近的正規性と効率性を確立すること。
  • MSCLEが、IPWを含む漸近的に不偏な推定量のクラスの中で最小の漸近的分散を達成することを示すこと。
  • パイロット標本を用いた実用的な推定手順を提供し、パイロットが誤指定されている場合でも有効であることを示すこと。

提案手法

  • 標本化されたデータの条件付き対数尤度に基づく最大標本条件付き尤度推定量(MSCLE)を提案する。
  • 重み付けではなく、実現された標本抽出確率を尤度に組み込むことで、選択された標本に含まれる情報を損なわないようにする。
  • 標本化された対数尤度を $\ell_S(\bm{\theta} \mid \tilde{\bm{\vartheta}}_{\text{plt}}) = \sum_{i=1}^N \delta_i \left[ \log f(y_i \mid \bm{x}_i; \bm{\theta}) - \log \bar{\pi}_N(\bm{x}_i; \bm{\theta} \mid \tilde{\bm{\vartheta}}_{\text{plt}}) \right] + C$ と定義する。ここで $\bar{\pi}_N$ は選択確率の条件付き期待値である。
  • 正則性条件(勾配関数およびヘッセ関数のモーメントバウンドを含む)の下でMSCLEの漸近的分布を導出する。
  • MSCLEの漸近的分散が、漸近的に不偏な推定量の中で最小であることを確立し、Cramér-Raoの下界に達していることを示す。
  • パイロット推定量 $\tilde{\bm{\vartheta}}_{\text{plt}}$ を用いて標本抽出確率を推定し、これが確率的に収束し、全データとは独立であると仮定する。

実験結果

リサーチクエスチョン

  • RQ1実現された標本抽出確率を活用する尤度ベースの推定量は、情報的標本抽出において逆確率重み付け(IPW)よりも高い効率性を達成できるか?
  • RQ2最大標本条件付き尤度推定量(MSCLE)は、不偏推定量の中で最小の漸近的分散を達成するか?
  • RQ3パイロット誤指定(パイロット推定量が不一致またはバイアスを持つ)下でMSCLEはどのように性能を発揮するか?
  • RQ4一般の情報的標本抽出設計($n = o(N)$ を満たす)下で、MSCLEの漸近的分布はどのようなものか?
  • RQ5パイロット標本を用いてMSCLEを実用的に実装可能か?また、パイロットが完全に代表的でない場合でも効率性を維持できるか?

主な発見

  • MSCLEは、すべての漸近的に不偏な推定量の中で最小の漸近的分散を達成し、統計的に効率的であり、Cramér-Raoの下界に到達することが証明された。
  • MSCLEはIPW推定量よりもパイロット誤指定に対して頑健であり、パイロット推定量が不一致であっても良好な性能を維持する。
  • 正則性条件(勾配関数およびヘッセ関数のモーメントバウンドを含む)の下で、MSCLEの漸近的正規性が確立された。
  • 提案手法は標本サイズ $n = o(N)$ を許容するため、計算コストを著しく削減できる大規模データに適している。
  • 数値実験により、MSCLEがIPWを上回る推定効率性と収束速度を示した。特に、非平衡またはレアイベントの設定下で顕著な優位性を示した。
  • IPWとは異なり、MSCLEは選択確率が0から離れている必要がないため、高次元またはスパースな標本抽出の場面でもより柔軟に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。