Skip to main content
QUICK REVIEW

[논문 리뷰] Soft Gradient Boosting Machine

Ji Feng, Yi-Xuan Xu|arXiv (Cornell University)|2020. 06. 07.
Face and Expression Recognition참고 문헌 31인용 수 9
한 줄 요약

이 논문은 소프트 기울기 부스팅 머신(sGBM)을 제안한다. sGBM는 순차적 학습 방식을 버리고 국소적 및 전역적 손실 목표를 동시에 최적화하는, 미분 가능한 공동 최적화 기반의 앙상블 모델이다. 기저 학습기로 미분 가능한 소프트 결정 트리를 사용함으로써, 기존의 XGBoost와 같은 전통적인 기울기 부스팅 머신에 비해 10배 이상의 속도 향상, 더 높은 정확도, 그리고 온라인 학습 및 지식 정복 성능 향상을 달성한다.

ABSTRACT

Gradient Boosting Machine has proven to be one successful function approximator and has been widely used in a variety of areas. However, since the training procedure of each base learner has to take the sequential order, it is infeasible to parallelize the training process among base learners for speed-up. In addition, under online or incremental learning settings, GBMs achieved sub-optimal performance due to the fact that the previously trained base learners can not adapt with the environment once trained. In this work, we propose the soft Gradient Boosting Machine (sGBM) by wiring multiple differentiable base learners together, by injecting both local and global objectives inspired from gradient boosting, all base learners can then be jointly optimized with linear speed-up. When using differentiable soft decision trees as base learner, such device can be regarded as an alternative version of the (hard) gradient boosting decision trees with extra benefits. Experimental results showed that, sGBM enjoys much higher time efficiency with better accuracy, given the same base learner in both on-line and off-line settings.

연구 동기 및 목표

  • 기존 기울기 부스팅 머신(GBM)에서 발생하는 순차적 학습 병목 현상으로 인한 병렬 처리 및 확장성 제약 문제를 해결하기 위해.
  • 이전에 학습된 기저 학습기가 새로운 데이터에 적응할 수 없는 상황에서, GBM 유사 모델에서 온라인 및 누적 학습을 가능하게 하기 위해.
  • 하드 결정 트리 기반 GBM의 대체로, 공동 최적화와 계층적 표현 학습을 지원하는, 미분 가능한 모델을 개발하기 위해.
  • 기저 학습기 간의 더 rich한 상호작용을 가능하게 하여, 다중 출력 회귀 및 지식 정복 성능을 향상시키기 위해 소프트, 미분 가능한 구성 요소를 도입하기 위해.

제안 방법

  • 기본 학습기(예: 소프트 결정 트리)를 다수 연결하여, 방향 비순환 그래프(DAG) 아키텍처를 사용해 하나의 미분 가능한 아키텍처로 구성한다.
  • 각 기저 학습기에 국소적 손실을 도입하여 잔차 오차를 최소화하고, 전체 모델 성능을 정규화하기 위해 전역적 손실을 도입한다.
  • 전체 모델은 확률적 경사 하강법(SGD) 또는 그 변종을 통해 공동 최적화되며, 엔드 투 엔드 학습이 가능하고 병렬 처리에 따라 선형적인 속도 향상을 달성한다.
  • 기본 학습기로 소프트 결정 트리를 사용함으로써, 트리 구조를 통해 기울기 흐름이 가능하고, 미분 가능한 라우팅 및 분할 결정이 가능해진다.
  • 학습 중 원핫 레이블을 조밀한 벡터로 변환함으로써, 자연스럽게 다차원 회귀 및 지식 정복을 지원한다.
  • 학습률 및 가중치 감쇠 등의 하이퍼파라미터는 검증을 통해 튜닝되었으며, 실험에서는 Adam 옵timizer를 사용하였다.

실험 결과

연구 질문

  • RQ1미분 가능하고 공동 최적화되는 앙상블 모델이 기존 순차적 GBM보다 학습 속도와 정확도에서 뛰어난 성능을 보일 수 있는가?
  • RQ2소프트 GBM 프레임워크가 새로운 데이터 배치에 적응하기 위해 다시 처음부터 학습하지 않고도 효과적인 온라인/누적 학습을 지원할 수 있는가?
  • RQ3sGBM가 딥 네URAL 네트워크에서 지식 정복을 효과적으로 수행할 수 있는가, 특히 소프트 레이블 분포를 전이할 때 성능이 뛰어난가?
  • RQ4sGBM에서 미분 가능한 기저 학습기 간의 상호작용이 기존 앙상블 방법이나 하드 GBM 대비 모델 용량 및 일반화 능력 측면에서 어떻게 비교되는가?

주요 결과

  • 같은 기저 학습기를 사용할 때 sGBM는 XGBoost 대비 학습 시간에서 10배 이상의 속도 향상을 기록했으며, 모든 벤치마크 데이터셋에서 더 높은 테스트 정확도를 달성했다.
  • 다중 출력 회귀 작업에서는 sGBDT(sGBM의 트리 기반 변종)가 XGBoost-MO를 능가했으며, 평균 제곱 오차가 더 낮았다(예: scm1d에서 0.0981 ± 0.0014 vs. 0.1302 ± 0.0045).
  • 누적 학습 환경에서는 sGBDT가 XGBoost보다 더 빠르게 수렴했고, 데이터 배치가 증가함에 따라 성능 저하가 더 적었다.
  • sGBDT는 CNN에서 지식 정복을 성공적으로 수행했으며, MNIST에서 97.57%의 테스트 정확도를 기록했다(XGBoost는 지식 정복 없이 94.61%였고, 소프트 레이블을 사용할 경우 성능이 저하되었다).
  • 소프트 결정 트리를 사용함으로써 다차원 출력을 자연스럽게 처리할 수 있었고, 기저 학습기 간의 상호작용이 향상되어 일반화 능력과 정복 능력이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.