Skip to main content
QUICK REVIEW

[논문 리뷰] Logistic Regression for Massive Data with Rare Events

Haiying Wang|arXiv (Cornell University)|2020. 06. 01.
Imbalanced Data Classification Techniques참고 문헌 11인용 수 9
한 줄 요약

이 논문은 막대한 희귀 사건 데이터에 대한 로지스틱 회귀분석의 엄밀한 점점적 분석을 제공하며, 추정 효율성이 총 표본 크기보다는 사건 수에 의존함을 보여준다. 이는 과도한 샘플링을 통한 제어의 효율성을 유지함을 증명하며, 과도하게 사건을 샘플링할 경우 효율성이 감소할 수 있음을 보여주어, 불균형 데이터 설정에서 비용 효율적인 샘플링 전략에 대한 이론적 근거를 제공한다.

ABSTRACT

This paper studies binary logistic regression for rare events data, or imbalanced data, where the number of events (observations in one class, often called cases) is significantly smaller than the number of nonevents (observations in the other class, often called controls). We first derive the asymptotic distribution of the maximum likelihood estimator (MLE) of the unknown parameter, which shows that the asymptotic variance convergences to zero in a rate of the inverse of the number of the events instead of the inverse of the full data sample size. This indicates that the available information in rare events data is at the scale of the number of events instead of the full data sample size. Furthermore, we prove that under-sampling a small proportion of the nonevents, the resulting under-sampled estimator may have identical asymptotic distribution to the full data MLE. This demonstrates the advantage of under-sampling nonevents for rare events data, because this procedure may significantly reduce the computation and/or data collection costs. Another common practice in analyzing rare events data is to over-sample (replicate) the events, which has a higher computational cost. We show that this procedure may even result in efficiency loss in terms of parameter estimation.

연구 동기 및 목표

  • 희귀 사건 데이터에서 사건 수가 비사건 수보다 훨씬 적을 때 진정한 정보의 양을 이해하기 위해.
  • 희귀 사건 데이터에서 일반적인 샘플링 기법—제어의 과도한 샘플링과 사건의 과도한 샘플링—이 로지스틱 회귀에서 모수 추정에 미치는 통계적 영향을 평가하기 위해.
  • 사건 빈도가 감소하는 상황에서 추정기의 점점적 분포를 수립하기 위해, 사건 수가 비사건 수보다 느리게 증가함.
  • 희귀 사건 설정에서 샘플링이 정보 손실 또는 효율성 향상으로 이어지는지에 대한 직관에 어긋나는 질문을 해결하기 위해.

제안 방법

  • 사건 빈도가 0으로 감소하는 상황에서 사건과 비사건의 수가 증가하는 랜덤한 상황에서 최대우도추정기(MLE)의 점점적 분포를 유도한다.
  • MLE가 총 표본 크기 대신 사건 수에 반비례하는 속도로 수렴함을 보여주며, 이는 정보가 희귀한 사례에 의해 제한됨을 시사한다.
  • 낮은 비율의 비사건만 포함된 제어의 과도한 샘플링을 통한 추정기의 점점적 분포가 전체 데이터 MLE와 동일함을 증명하며, 이는 효율성 손실이 없음을 의미한다.
  • 사건을 복제하여 과도하게 샘플링한 추정기의 분석을 통해 전체 데이터 MLE보다 더 큰 점점적 분산을 가질 수 있음을 보여주며, 이는 효율성 손실을 의미한다.
  • Lindeberg-Feller 중심극한정리와 약한 모멘트 조건 하에서 점점적 정규성을 확립하기 위해 모멘트 경계를 사용한다.
  • 비사건의 수가 랜덤한 포isson 분포를 따를 것으로 가정하고, 비사건의 수가 랜덤하게 증가하는 상황을 모델링하기 위해 편향 기법을 사용하며 수렴 속도를 도출한다.

실험 결과

연구 질문

  • RQ1희귀 사건 데이터의 정보 내용은 전체 표본 크기로 증가하는가, 아니면 사건 수에만 의존하는가?
  • RQ2희귀 사건 로지스틱 회귀에서 제어의 과도한 샘플링이 전체 데이터 MLE의 점점적 효율성을 유지할 수 있는가?
  • RQ3사건의 과도한 샘플링은 전체 데이터 MLE에 비해 추정 효율성을 감소시키는가?
  • RQ4사건 빈도가 0으로 감소할 때 MLE의 올바른 수렴 속도는 무엇인가?
  • RQ5제어의 과도한 샘플링과 사건의 과도한 샘플링을 통한 추정기가 전체 데이터 MLE와 동일하거나 다른 점점적 분포를 가지는 조건은 무엇인가?

주요 결과

  • MLE의 점점적 분산은 전체 표본 크기 대신 사건 수에 반비례하는 속도로 0으로 수렴하며, 이는 정보가 희귀한 사례에 의해 제한됨을 시사한다.
  • 제어의 과도한 샘플링을 통한 추정기는 전체 데이터 MLE와 동일한 점점적 분포를 가지며, 이는 효율성 손실이 없음을 의미한다.
  • 사건의 과도한 샘플링은 전체 데이터 MLE보다 더 큰 점점적 분산을 가진 추정기를 초래하며, 이는 추정 효율성 손실을 의미한다.
  • MLE의 수렴 속도는 전체 표본 크기 대신 사건 수에 의해 결정되며, 전체 데이터 크기가 막대하더라도 마찬가지다.
  • 이론적 프레임워크는 사건과 비사건의 수가 모두 랜덤하게 증가하고 사건 빈도가 0으로 감소하는 상황을 수용할 수 있어, 극심한 불균형을 더 현실적으로 모델링한다.
  • 결과는 희귀 사건 로지스틱 회귀에서 계산 효율성이 떨어지지 않으면서 통계적 효율성을 유지할 수 있는 제어의 과도한 샘플링 전략의 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.