Skip to main content
QUICK REVIEW

[論文レビュー] Logistic Regression for Massive Data with Rare Events

Haiying Wang|arXiv (Cornell University)|Jun 1, 2020
Imbalanced Data Classification Techniques参考文献 11被引用数 9
ひとこと要約

本稿は、マスサイズのレアイベントデータにおけるロジスティック回帰の厳密な漸近的分析を提供し、推定の効率が全サンプルサイズではなくイベント数に依存することを示している。また、アンダーサンプリングによるコントロールの保持が漸近的効率を維持することを証明しており、イベントのオーバーサンプリングはその効率を低下させることもある。これは、不均衡データ設定におけるコスト効率の高いサンプリング戦略の理論的裏付けを提供する。

ABSTRACT

This paper studies binary logistic regression for rare events data, or imbalanced data, where the number of events (observations in one class, often called cases) is significantly smaller than the number of nonevents (observations in the other class, often called controls). We first derive the asymptotic distribution of the maximum likelihood estimator (MLE) of the unknown parameter, which shows that the asymptotic variance convergences to zero in a rate of the inverse of the number of the events instead of the inverse of the full data sample size. This indicates that the available information in rare events data is at the scale of the number of events instead of the full data sample size. Furthermore, we prove that under-sampling a small proportion of the nonevents, the resulting under-sampled estimator may have identical asymptotic distribution to the full data MLE. This demonstrates the advantage of under-sampling nonevents for rare events data, because this procedure may significantly reduce the computation and/or data collection costs. Another common practice in analyzing rare events data is to over-sample (replicate) the events, which has a higher computational cost. We show that this procedure may even result in efficiency loss in terms of parameter estimation.

研究の動機と目的

  • マスサイズのレアイベントデータにおける真の情報量を理解すること。ここでは、イベント数が非イベント数に比べてはるかに小さい。
  • アンダーサンプリングによるコントロールのサンプリングとイベントのオーバーサンプリングという一般的な実践的アプローチが、ロジスティック回帰におけるパラメータ推定に与える統計的影響を評価すること。
  • イベントレートが減少する条件下で推定量の漸近的分布を確立すること。ここでは、ケースの数がコントロールの数よりも遅く増加する。
  • レアイベント設定において、サンプリングが情報の損失をもたらすのか、あるいは効率の向上をもたらすのかという直感に反する疑問を解消すること。

提案手法

  • イベントレートがゼロに減少する中で、増加するケースとコントロールのランダムな数を伴う条件下で、最尤推定量(MLE)の漸近的分布を導出する。
  • MLEが、全サンプルサイズではなくイベント数に逆比例するレートで収束することを示し、情報がレアケースによって制限されることを示唆する。
  • アンダーサンプリングによる推定量(コントロールの少数を含む)が、全データMLEと同一の漸近的分布を持つことを証明し、効率の損失がないことを示唆する。
  • イベントのオーバーサンプリングによる推定量を分析し、全データMLEよりも大きい漸近的分散を持つことがあることを示し、効率の損失を示唆する。
  • リンデバーグ=フレラーの中心極限定理と弱いモーメント条件の下でのモーメントバウンドを用いて、弱いモーメント条件下でも漸近的正規性を確立する。
  • 非イベントのランダムな増加をモデル化するため、ランダムなポアソン分布のコントロール数を用いた摂動アプローチを採用し、収束レートを導出する。

実験結果

リサーチクエスチョン

  • RQ1レアイベントデータにおける情報量は、全サンプルサイズに比例するのか、それともイベント数にのみ比例するのか?
  • RQ2アンダーサンプリングによるコントロールのサンプリングは、レアイベントのロジスティック回帰において、全データMLEの漸近的効率を維持できるか?
  • RQ3イベントのオーバーサンプリングは、全データMLEと比較して推定効率を損なうのか?
  • RQ4イベントレートがゼロに減少する際、MLEの正しい収束レートは何か?
  • RQ5アンダーサンプリングおよびオーバーサンプリング推定量が、全データMLEと同一または異なる漸近的分布を持つ条件は何か?

主な発見

  • MLEの漸近的分散は、全サンプルサイズではなくイベント数に逆比例するレートでゼロに収束する。これは、情報がレアケースによって制限されることを示唆する。
  • アンダーサンプリングによるコントロールのサンプリングは、全データMLEと同一の漸近的分布を持つ推定量をもたらし、効率の損失がないことを示唆する。
  • イベントのオーバーサンプリングは、全データMLEよりも大きい漸近的分散を持つ推定量をもたらし、推定効率の損失を示唆する。
  • MLEの収束レートは、全サンプルサイズではなくイベント数によって決定され、全データのボリュームが非常に大きくても同様である。
  • 理論的枠組みは、ケースとコントロールの両方のランダムな増加を許容し、イベントレートがゼロに減少する状況をより現実的にモデル化できる。
  • 本研究の結果は、レアイベントのロジスティック回帰において、アンダーサンプリングを計算的に効率的かつ統計的に効率を損なわずに使用できるという根拠を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。