Skip to main content
QUICK REVIEW

[논문 리뷰] SketchBoost: Fast Gradient Boosted Decision Tree for Multioutput Problems

Leonid Iosipoi, Anton Vakhrushev|arXiv (Cornell University)|2022. 11. 23.
Machine Learning and Data Classification인용 수 10
한 줄 요약

SketchBoost는 스킴 기반 근사 스코링 기법을 사용하여 다중출력 문제를 위한 빠른 기울기 부스팅 결정 트리 프레임워크를 제안한다. 이는 훈련 속도를 최대 40배 빠르게 하면서도 모델 성능을 유지하거나 향상시킨다. 이는 모델 성능을 유지하면서도 다중 출력에서의 정보 이득을 효율적으로 근사화하여, GPU 가속화된 가변형 GBDT 라이브러리인 Py-Boost에 통합된다.

ABSTRACT

Gradient Boosted Decision Tree (GBDT) is a widely-used machine learning algorithm that has been shown to achieve state-of-the-art results on many standard data science problems. We are interested in its application to multioutput problems when the output is highly multidimensional. Although there are highly effective GBDT implementations, their scalability to such problems is still unsatisfactory. In this paper, we propose novel methods aiming to accelerate the training process of GBDT in the multioutput scenario. The idea behind these methods lies in the approximate computation of a scoring function used to find the best split of decision trees. These methods are implemented in SketchBoost, which itself is integrated into our easily customizable Python-based GPU implementation of GBDT called Py-Boost. Our numerical study demonstrates that SketchBoost speeds up the training process of GBDT by up to over 40 times while achieving comparable or even better performance.

연구 동기 및 목표

  • 다중출력 설정(다중분류, 다중라벨, 다중출력 회귀 등)에서 기울기 부스팅 결정 트리(GBDT)의 확장성 문제를 해결한다.
  • 단일 트리 GBDT 훈련에서 가장 시간이 오래 걸리는 다변량 결정 트리의 분할 스코링 계산 비용을 줄인다.
  • 모델 정확도나 일반화 능력을 훼손하지 않으면서 다중 출력 간 정보 이득을 근사화하는 방법을 개발한다.
  • GPU 가속화와 스킴 기반 기법을 활용하여 대규모 고차원 출력 문제에서 효율적인 훈련을 가능하게 한다.
  • 실제 구현에 적합한 유연하고 개방형 GPU 기반 GBDT 프레임워크(Py-Boost)에 이 방법을 통합한다.

제안 방법

  • 다중변량 결정 트리 분할을 위한 스코링 함수를 근사화하기 위해 무작위 투영과 스킴 기반 기법을 사용하는 새로운 방법인 SketchBoost를 제안한다.
  • 트리 구조 탐색 중에 다중 출력 차원을 통해 정보 이득을 스킴 기반으로 추정하여 전체 출력 계산을 줄인다.
  • GPU 가속화된 GBDT 프레임워크(Py-Boost)에 스킴 기반 스코링을 통합하여 병렬 처리와 고속 메모리 액세스를 활용한다.
  • 스킵 차원 $k$를 하이퍼파라미터로 사용하여 속도와 근사 정확도 사이의 트레이드오프를 제어한다.
  • 정확도와 성능에 대한 내성과 탄력성을 평가하기 위해 무작위 투영과 무작위 샘플링을 스킴 기법의 변형으로 구현한다.
  • 모든 출력을 동시에 최적화하는 단일 트리 전략을 유지하되, 분할 평가 단계에서 스킴 기반 기법을 통해 가속화한다.

실험 결과

연구 질문

  • RQ1스킵 기반 근사 스코링을 통해 다중출력 GBDT의 훈련 시간을 크게 줄일 수 있는가, 이때 모델 성능이 저하되지 않는가?
  • RQ2스킵 기법의 선택(무작위 투영 대비 무작위 샘플링)이 속도와 정확도 사이의 트레이드오프에 어떤 영향을 미치는가?
  • RQ3기존의 GBDT 프레임워크(XGBoost, CatBoost 등)에 비해 SketchBoost는 고차원 출력 문제에 얼마나 잘 스케일링되는가?
  • RQ4스킵 기반 기법이 다중출력 학습 과제에서 일반화 성능을 유지하거나 향상시키는가?
  • RQ5제안된 방법은 GPU 가속화된 실무용 GBDT 프레임워크에 효율적으로 통합될 수 있는가?

주요 결과

  • SketchBoost는 XGBoost와 CatBoost에 비해 다중출력 문제에서 훈련 시간을 최대 40배 빠르게 하며, 훈련 시간을 수백 초에서 수십 초로 단축시켰다.
  • MNIST와 Caltech 데이터셋에서 SketchBoost는 무작위 투영($k=1$)을 사용하여 각각 테스트 정확도 0.973±0.0028과 0.5549±0.008를 달성했으며, Caltech에서 CatBoost와 GBDT-MO(sparse)를 모두 능가하는 정확도를 보였다.
  • NUS-WIDE 다중라벨 데이터셋에서 SketchBoost는 정확도 0.9893±0.0002를 기록했으며, 모든 스킴 차원에서 기준선을 모두 충족하거나 초월했다.
  • MNIST-REG 회귀 과제에서 SketchBoost는 RMSE 0.266±0.0019를 달성했으며, GBDT-MO(sparse)를 포함한 모든 기준선과 비교해 유사하거나 뛰어난 성능을 보였다.
  • 모든 데이터셋에서 SketchBoost의 훈련 시간은 일관되게 100초 이내였고, NUS-WIDE에서 CatBoost는 13,000초 이상 소요되어 스케일링 면에서 뛰어난 성능을 보였다.
  • 스킵 차원 $k=1$에서 $k=20$까지의 다양한 스킴 차원에서도 높은 성능을 유지하여, 다양한 스킴 차원에서의 근사 기법의 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.