Skip to main content
QUICK REVIEW

[논문 리뷰] Minimal Variance Sampling in Stochastic Gradient Boosting

Bulat Ibragimov, Gleb Gusev|arXiv (Cornell University)|2019. 10. 29.
Machine Learning and Data Classification인용 수 12
한 줄 요약

이 논문은 최소 분산 샘플링(MVS)을 제안하며, 확률적 경사 부스팅(SGB)을 위한 새로운 가중 샘플링 기법이다. 이 기법은 분할 점수 평가에서 분산을 최소화하도록 샘플링 확률을 최적화하여, 더 적은 학습 예제로도 높은 모델 정확도를 달성한다. MVS는 경사의 크기에 기반해 샘플을 적응적으로 가중함으로써, 기존 SGB 및 GOSS와 비교해 최대 50%까지 필요한 샘플 수를 줄이며 정확도를 향상하거나 유지한다.

ABSTRACT

Stochastic Gradient Boosting (SGB) is a widely used approach to regularization of boosting models based on decision trees. It was shown that, in many cases, random sampling at each iteration can lead to better generalization performance of the model and can also decrease the learning time. Different sampling approaches were proposed, where probabilities are not uniform, and it is not currently clear which approach is the most effective. In this paper, we formulate the problem of randomization in SGB in terms of optimization of sampling probabilities to maximize the estimation accuracy of split scoring used to train decision trees. This optimization problem has a closed-form nearly optimal solution, and it leads to a new sampling technique, which we call Minimal Variance Sampling (MVS). The method both decreases the number of examples needed for each iteration of boosting and increases the quality of the model significantly as compared to the state-of-the art sampling methods. The superiority of the algorithm was confirmed by introducing MVS as a new default option for subsampling in CatBoost, a gradient boosting library achieving state-of-the-art quality on various machine learning tasks.

연구 동기 및 목표

  • 확률적 경사 부스팅(SGB)에서 데이터 샘플링에 대한 이론적 최적화가 부족한 문제를 해결하기 위해, 기존 방법들이 임의적이거나 히ュ리스틱 기반의 샘플링 확률을 사용한다는 점을 다루기 위해.
  • SGB에서의 샘플링 문제를 나무 구축 중 분할 점수 평가의 정확도를 최대화하는 최적화 문제로 재정의하기 위해.
  • 경사 추정치의 분산을 최소화하는 데 기여하는 닫힌 형태의 거의 최적의 샘플링 확률 해를 유도하기 위해.
  • 정확도와 효율성 측면에서 균일 샘플링 및 최첨단 샘플링 기법을 초월하는 실용적이고 적응적인 샘플링 방법인 최소 분산 샘플링(MVS)을 개발하기 위해.
  • 다양한 데이터셋에서 MVS를 실증적으로 검증하고, CatBoost의 기본 서브샘플링 전략으로 통합하기 위해.

제안 방법

  • 분할 점수 평가에 사용되는 경사 추정치의 분산을 최소화하는 것이 목표인 샘플링 문제를 제약 조건이 있는 최적화 문제로 설정하기 위해.
  • 절대값의 경사 도함수(손실 경사)에 따라 의존하는 닫힌 형태의 샘플링 확률 해를 유도하며, 더 큰 경사 값을 가진 예제일수록 더 높은 샘플링 확률을 부여하기 위해.
  • 샘플링 효율성과 분산 감소 사이의 트레이드오프를 제어하기 위해 하이퍼파라미터 λ를 도입하여 적응적 샘플링을 가능하게 하기 위해.
  • 데이터 분포에 따라 자동으로 λ를 조정함으로써 수동 설정이 필요 없도록 하는 MVS Adaptive라는 변형을 제안하기 위해.
  • SGB 및 GOSS와 동일한 학습 조건에서 직접 비교가 가능하도록 CatBoost 및 LightGBM에 MVS를 구현하기 위해.
  • 다양한 벤치마크 데이터셋을 대상으로 실증 평가를 수행하여, 다양한 방법 간의 모델 정확도, 학습 시간, 필요 샘플 수를 비교하기 위해.

실험 결과

연구 질문

  • RQ1경사 부스팅 나무 구축 중 분할 점수 평가에서 분산을 최소화하기 위한 최적의 샘플링 분포는 무엇인가?
  • RQ2이론적으로 근거가 있는 닫힌 형태의 샘플링 전략이 히ュ리스틱 또는 균일 샘플링을 초월해 정확도와 학습 효율성 측면에서 뛰어나게 되는가?
  • RQ3더 적은 샘플 크기를 사용할 경우 MVS는 SGB 및 GOSS와 비교해 모델 정확도에서 어떻게 성능을 내는가?
  • RQ4MVS는 모델 성능을 유지하거나 향상시키면서 학습 시간을 얼마나 줄일 수 있는가?
  • RQ5MVS의 적응형 버전은 하이퍼파라미터 튜닝이 필요 없이도 최적의 성능을 유지할 수 있는가?

주요 결과

  • MVS는 SGB 대비 반복당 필요한 샘플 수를 최대 50%까지 줄이며, 정확도를 유지하거나 향상시킨다.
  • 샘플 비율 0.5를 사용할 경우, MVS는 기준 모델 대비 평균적으로 상대 오차 감소율 -0.45%를 기록하며, SGB 및 GOSS를 모두 초월한다.
  • Higgs 데이터셋의 경우, MVS는 80%의 샘플 비율에서 기준 성능을 달성하지만, SGB는 100% 이하에서는 실패함을 보여주며, 더 뛰어난 샘플 효율성을 입증한다.
  • Recsys 데이터셋에서는 MVS가 10%의 샘플 비율에서 학습 시간을 61.5% 감소시켰으며, SGB 및 GOSS를 크게 앞서나간다.
  • MVS Adaptive는 하이퍼파라미터 튜닝 없이도 거의 최적의 성능을 달성하여 튜닝 오버헤드를 줄이고 높은 정확도를 유지한다.
  • MVS는 이제 CatBoost의 기본 서브샘플링 방법이 되었으며, LightGBM에도 통합되어 실용적 우수성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.