Skip to main content
QUICK REVIEW

[論文レビュー] More Efficient Estimation for Logistic Regression with Optimal Subsample

HaiYing Wang|arXiv (Cornell University)|Feb 8, 2018
Statistical Methods and Inference参考文献 43被引用数 6
ひとこと要約

本稿は、Wangら(2018)で導出された最適サブサンプリング確率を用いて、より効率的なロジスティック回帰推定手法を提案する。新たな重み付け方式とポアソンサブサンプリングを導入することで、推定の効率性と計算スケーラビリティが向上する。主な貢献は、逆確率重み付け推定量よりも小さい漸近的分散を有する新たな推定量の確立であり、特にサブサンプルサイズが全データサイズに比例する場合に高い効率性を達成する。

ABSTRACT

In this paper, we propose improved estimation method for logistic regression based on subsamples taken according the optimal subsampling probabilities developed in Wang et al. 2018 Both asymptotic results and numerical results show that the new estimator has a higher estimation efficiency. We also develop a new algorithm based on Poisson subsampling, which does not require to approximate the optimal subsampling probabilities all at once. This is computationally advantageous when available random-access memory is not enough to hold the full data. Interestingly, asymptotic distributions also show that Poisson subsampling produces a more efficient estimator if the sampling rate, the ratio of the subsample size to the full data sample size, does not converge to zero. We also obtain the unconditional asymptotic distribution for the estimator based on Poisson subsampling. The proposed approach requires to use a pilot estimator to correct biases of un-weighted estimators. We further show that even if the pilot estimator is inconsistent, the resulting estimators are still consistent and asymptotically normal if the model is correctly specified.

研究の動機と目的

  • 大規模データセットにおけるロジスティック回帰の推定効率を向上させるために、最適サブサンプルの重み付け方式を精緻化すること。
  • 全データがメモリに収まらない場合の計算制限に対処するため、すべてのサブサンプリング確率を保存する必要がないポアソンサブサンプリングを導入すること。
  • サブサンプル比が0に収束しない場合に、ポアソンサブサンプリング下での新しい推定量の漸近的分布を確立し、その効率性を示すこと。
  • パイロット推定量が不一致であっても、提案手法が一貫性があり、漸近的に正規分布に従う推定量を生成することを示すこと。

提案手法

  • Wangら(2018)で得られた最適サブサンプリング確率を用いるが、漸近的分散を低減するために、改良された重み付け方式を適用する新たな推定量を提案する。
  • ベルヌーイ分布または非復元抽出とは異なり、すべてのサブサンプリング確率を同時に計算・保存する必要がない計算効率の高い代替手法として、ポアソンサブサンプリングを導入する。
  • ポアソンサブサンプリングに基づく推定量の周辺的漸近的分布を導出し、サブサンプルサイズが全データサイズに比例する場合、逆確率重み付け推定量よりも効率的であることを示す。
  • 二段階アプローチを採用:第一段階でパイロット推定量を用いてサブサンプリング確率を計算し、第二段階で補正された重み付け方式を用いて最終推定量を算出する。
  • HjortおよびPollard(2011)の基本補題を用いて、条件付き期待値下での推定量の漸近的正規性を導出する。
  • 漸近的解析およびマルティングルの中心極限定理の手法を用いて、推定量の極限分布および分散・共分散構造を導出する。

実験結果

リサーチクエスチョン

  • RQ1最適サブサンプリングにおけるロジスティック回帰の推定において、逆確率重み付け推定量を上回る推定効率を達成するためのより良い重み付け方式は可能か?
  • RQ2サブサンプルサイズが全データサイズに比例する場合、ポアソンサブサンプリングは他の抽出方式よりも効率的な推定量を生成するか?
  • RQ3パイロット推定量が不一致であっても、提案手法は一貫性および漸近的正規性を保つことができるか?
  • RQ4ポアソンサブサンプリング下での推定量の周辺的漸近的分布は何か? また、条件付き分布と比較してどのように異なるか?
  • RQ5新しい推定量の漸近的分散は、逆確率重み付け推定量と比較して、Loewner順序でどのように関係するか?

主な発見

  • Wangら(2018)の逆確率重み付け推定量よりも、提案手法の漸近的分散・共分散行列が小さいことが、Loewner順序によって確認された。
  • サブサンプルサイズが全データサイズに比例する場合(すなわち、n/N → ρ > 0)、ポアソンサブサンプリングは逆確率重み付け推定量よりもより効率的な推定量を生成する。
  • ポアソンサブサンプリングに基づく推定量の周辺的漸近的分布が導出され、それが漸近的に正規分布に従い、重み付け推定量のそれよりも分散・共分散行列が小さいことが示された。
  • パイロット推定量が不一致であっても、最終推定量は一貫性を保ち、漸近的に正規分布に従うことが確認され、パイロット推定誤差に対して強いロバストネスを示した。
  • ポアソンサブサンプリングでは、すべてのサブサンプリング確率を同時に保存する必要がないため、計算上の利点があり、メモリ制限のある環境に適している。
  • 数値結果により、新しい推定量は、特に大規模なロジスティック回帰設定において、既存の手法よりも高い推定効率を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。