Skip to main content
QUICK REVIEW

[論文レビュー] Local case-control sampling: Efficient subsampling in imbalanced data sets

William Fithian, Trevor Hastie|Jun 16, 2013
Imbalanced Data Classification Techniques被引用数 8
ひとこと要約

本稿では、パilot推定値を用いて条件付きにまれなケースを優先的に選択することで、計算効率を向上させる不均衡なロジスティック回帰データのための局所的ケースコントロールサンプリングというサブサンプリング手法を提案する。この手法は予測確率に基づく受容・棄却スキームを用い、バイアスを解析的に補正し、正しいモデル仕様のもとで、完全標本のMLEの2倍以内の漸近的効率性を達成する——たとえ極めて小さなサブサンプルであっても。

ABSTRACT

For classification problems with significant class imbalance, subsampling can reduce computational costs at the price of inflated variance in estimating model parameters. We propose a method for subsampling efficiently for logistic regression by adjusting the class balance locally in feature space via an accept-reject scheme. Our method generalizes standard case-control sampling, using a pilot estimate to preferentially select examples whose responses are conditionally rare given their features. The biased subsampling is corrected by a post-hoc analytic adjustment to the parameters. The method is simple and requires one parallelizable scan over the full data set. Standard case-control sampling is inconsistent under model misspecification for the population risk-minimizing coefficients $θ^*$. By contrast, our estimator is consistent for $θ^*$ provided that the pilot estimate is. Moreover, under correct specification and with a consistent, independent pilot estimate, our estimator has exactly twice the asymptotic variance of the full-sample MLE - even if the selected subsample comprises a miniscule fraction of the full data set, as happens when the original data are severely imbalanced. The factor of two improves to $1+\frac{1}{c}$ if we multiply the baseline acceptance probabilities by $c>1$ (and weight points with acceptance probability greater than 1), taking roughly $\frac{1+c}{2}$ times as many data points into the subsample. Experiments on simulated and real data show that our method can substantially outperform standard case-control subsampling.

研究の動機と目的

  • 大規模で不均衡なデータセットにおける計算非効率性を解消するため、統計的効率性を損なわずにデータサイズを縮小すること。
  • 特徴空間における条件付き不均衡を考慮しない従来のケースコントロールサンプリングの限界を克服すること。
  • 計算コストを著しく削減しながら統計的効率性を保持するサブサンプリング戦略を開発すること。
  • モデル不適合のもとでも、母集団リスク最小化係数の推定量の一致性と漸近的効率性を保証すること。
  • 1回のフルデータスキャンで実装可能な実用的で並列化可能な手法を提供すること。

提案手法

  • ロジスティック回帰パラメータのパilot推定値 (α̃, β̃) を用いて、各データポイントの応答がその特徴のもとで条件付きにどれほどまれであるかを評価する。
  • パilot推定値に基づき、Y が X に対して条件付きにまれな場合に高い確率で選択される受容・棄却サンプリングスキームを適用する。
  • 得られたバイアスのあるサブサンプルを、母集団パラメータ θ* の一貫性を保証するための解析的補正により補正する。
  • サブサンプルサイズを制御するために、受容確率を c > 1 の要因で調整し、受容確率が1を超える点には対応する重み付けスキームを導入する。
  • フルデータセットを1回の並列化可能なスキャンで処理するため、計算的に効率的であることを保証する。
  • ヘッセ行列とスコア関数を用いて漸近的分散の性質を導出し、正しいモデル仕様のもとで、推定量が完全標本MLEの正確に2倍の漸近的分散を持つことを示す。

実験結果

リサーチクエスチョン

  • RQ1マージナルなクラス不均衡だけでなく、局所的な条件付きまれさを考慮することで、不均衡なロジスティック回帰におけるサブサンプリング効率を向上させられるか?
  • RQ2モデル不適合のもとでも、局所的ケースコントロールサンプリングは母集団リスク最小化係数 θ* の一貫性のある推定量をもたらすか?
  • RQ3提案手法の推定量の漸近的分散は、完全標本MLEに対してどの程度で、サブサンプルサイズにどのように依存するか?
  • RQ4サブサンプルが元のデータのわずか数パーセントである場合でも、この手法は高い統計的効率性を維持できるか?
  • RQ5実データおよびシミュレーテッドデータにおいて、標準的ケースコントロールサンプリングと比較して、バイアス、分散、計算コストの観点でどのように異なるか?

主な発見

  • パilot推定値が一貫している限り、モデル不適合のもとでも推定量は θ* に対して一貫性を示す。
  • 正しいモデル仕様のもとで、一貫した独立したパilot推定値を用いる場合、推定量の漸近的分散は完全標本MLEの正確に2倍である。
  • 受容確率を c > 1 で乗算すると、漸近的分散は完全標本MLEの (1 + 1/c) 倍に改善され、サブサンプルサイズは元のデータの (1 + c)/2 倍に比例して増加する。
  • この手法はほぼ最適の統計的効率性を達成する:元のデータの1%未満のサブサンプルでも、推定量は高い精度を維持する。
  • シミュレーテッドおよび実データにおける実験から、標準的ケースコントロールサンプリングに比べて、推定精度と分散低減の両面で顕著に優れていることが示された。
  • この手法は計算的に効率的であり、フルデータセットを1回の並列化可能なスキャンで処理するため、大規模データにスケーラブルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。