Skip to main content
QUICK REVIEW

[논문 리뷰] What is the distribution of the number of unique original items in a bootstrap sample?

A. Mendelson, María A. Zuluaga|arXiv (Cornell University)|2016. 02. 18.
Statistical Methods and Inference참고 문헌 15인용 수 5
한 줄 요약

이 논문은 부트스트랩 샘플 내 고유한 항목의 분포에 대한 종합적인 분석을 제공하며, 핵심 성질을 유도하고 정규 근사에 대한 실용적인 히우리스틱을 제안한다. 단일 카테고리 및 다중 카테고리 설정 모두에서 이론적 점근 정규성을 확립하여, 배깅 및 검증 설계에서 모델 안정성을 제어하고 예측할 수 있도록 한다.

ABSTRACT

Sampling with replacement occurs in many settings in machine learning, notably in the bagging ensemble technique and the .632+ validation scheme. The number of unique original items in a bootstrap sample can have an important role in the behaviour of prediction models learned on it. Indeed, there are uncontrived examples where duplicate items have no effect. The purpose of this report is to present the distribution of the number of unique original items in a bootstrap sample clearly and concisely, with a view to enabling other machine learning researchers to understand and control this quantity in existing and future resampling techniques. We describe the key characteristics of this distribution along with the generalisation for the case where items come from distinct categories, as in classification. In both cases we discuss the normal limit, and conduct an empirical investigation to derive a heuristic for when a normal approximation is permissible.

연구 동기 및 목표

  • 모델 안정성과 성능에 중요한 영향을 미치는 부트스트랩 샘플 내 고유한 항목의 분포를 명확히 하기 위해.
  • 이 분포의 정규 근사가 허용되는 조건을 제공하는 실용적인 히우리스틱을 제시하여 기계학습 응용 분야에서의 사용성을 향상시키기 위해.
  • 분류 문제와 같이 항목이 서로 다른 카테고리에 속하는 다중 카테고리 설정으로 분포를 일반화하기 위해.
  • 앙상블 방법 및 검증 설계에서 부트스트랩 샘플의 정보 내용을 연구자들이 이해하고 제어할 수 있도록 지원하기 위해.

제안 방법

  • 지표 변수와 조합 확률을 사용하여 부트스트랩 샘플 내 고유한 항목 수의 정확한 분포를 유도한다.
  • 양의 상관관계를 가진 (PNQD) 수열과 가중합의 개념을 사용하여 분포의 점근 정규성을 확립한다.
  • empirical로 유도된 기반으로, 카테고리에서의 평균 횟수($\bar{a}_s$)와 카테고리 크기($N_s$)를 바탕으로 한 정규 근사에 대한 히우리스틱 규칙을 제안한다.
  • 다중 카테고리 상황으로의 분석을 확장하기 위해, 공동 점근 조건 하에서 각 카테고리의 고유한 항목 수를 다변량 정규 근사로 모델링한다.
  • 경계 케이스를 간소화된 오프셋 규칙으로 조정하면서, 히우리스틱을 실증적으로 검증한다.
  • 부트스트랩 재표본 추출에서의 복원 추출을 모델링하는 데 기초로 다항분포 실증 분포를 사용한다.

실험 결과

연구 질문

  • RQ1부트스트랩 샘플 크기가 $A$이고 원본 항목 수가 $N$일 때, 고유한 원본 항목 수의 정확한 분포는 무엇인가?
  • RQ2고유한 항목의 분포가 정규 분포로 근사될 수 있는 조건은 무엇인가?
  • RQ3분류 작업과 같이 항목이 여러 개의 서로 다른 카테고리에 속할 경우, 분포는 어떻게 일반화되는가?
  • RQ4다중 카테고리 부트스트랩 샘플 내 고유한 항목 수의 점근 정규성에 대한 이론적 근거는 무엇인가?
  • RQ5연구자들이 재표본 추출 기법에서 실용적으로 사용할 수 있도록 정규 근사가 타당한지 신뢰성 있게 판단할 수 있는 방법은 무엇인가?

주요 결과

  • 크기가 $A$인 부트스트랩 샘플에서 $N$개의 원본 항목을 추출할 때 고유한 항목 수의 분포는 지표 변수와 조합 합을 사용하여 닫힌 형태로 표현할 수 있다.
  • $N \to \infty$로 갈수록 이 분포는 점근적으로 정규분포가 되며, 이는 PNQD(양의 상관관계) 수열 성질에 의해 뒷받침된다.
  • 정규 근사에 대한 히우리스틱은 $1.4N_s^{0.67} \leq \bar{a}_s \leq 1.13(N_s - 8)^{1.19}$로, $\bar{a}_s \geq 9$ 및 $N_s \geq 14$ 조건에서 유효하다.
  • 다중 카테고리 문제에서는 공동 점근 조건 하에서 각 카테고리의 고유한 항목 수의 공동 분포가 다변량 정규분포로 수렴한다.
  • 이중 이항 근사 근사 조건과 단일 카테고리 조건이 모두 충족될 경우 정규 근사가 가장 신뢰할 수 있으며, 간소화된 규칙을 통해 경계 케이스를 오프셋으로 반영한다.
  • 결과는 특히 배깅 및 .632+ 검증에서 부트스트랩 샘플의 정보 내용을 제어하기 위한 이론적이고 실용적인 기초를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.