[논문 리뷰] MT-GBM: A Multi-Task Gradient Boosting Machine with Shared Decision Trees
MT-GBM는 다중 작업에서 공유되는 결정 트리 구조를 공동으로 최적화함으로써 다중 작업 학습을 효율적이고 효과적으로 가능하게 하는 새로운 다중 작업 그래디언트 부스팅 머신이다. 표형 데이터에서 단일 작업 GBDT 모델 대비 주 작업에서 최대 RMSE 23% 향상 및 MAPE 9% 향상되며, 공유 표현을 활용한 사기 탐지 작업에서 뚜렷한 성능 향상을 보였다.
Despite the success of deep learning in computer vision and natural language processing, Gradient Boosted Decision Tree (GBDT) is yet one of the most powerful tools for applications with tabular data such as e-commerce and FinTech. However, applying GBDT to multi-task learning is still a challenge. Unlike deep models that can jointly learn a shared latent representation across multiple tasks, GBDT can hardly learn a shared tree structure. In this paper, we propose Multi-task Gradient Boosting Machine (MT-GBM), a GBDT-based method for multi-task learning. The MT-GBM can find the shared tree structures and split branches according to multi-task losses. First, it assigns multiple outputs to each leaf node. Next, it computes the gradient corresponding to each output (task). Then, we also propose an algorithm to combine the gradients of all tasks and update the tree. Finally, we apply MT-GBM to LightGBM. Experiments show that our MT-GBM improves the performance of the main task significantly, which means the proposed MT-GBM is efficient and effective.
연구 동기 및 목표
- 다중 작업 학습에 Gradient Boosted Decision Trees(GBDT)를 적용하는 데 있어 공유 표현이 필수적이지만 학습하기 어려운 과제를 해결하기 위해.
- GBDT 모델이 트리 구조를 작업 간 공유함으로써 다중 손실 함수를 공동으로 최적화하여 일반화 능력과 효율성을 향상시키기 위해.
- 잔차 오차 크기의 변동이 큰 작업들 간의 훈련을 안정화시키기 위해 각 작업별로 학습률을 적응적으로 조정하기 위해.
- LightGBM와 같은 기존 GBDT 프레임워크에 최소한의 계산 오버헤드로 원활하게 통합될 수 있도록 방법을 개발하기 위해.
- 실제 표형 데이터 응용에서 주 작업 및 보조 작업 양쪽 모두에서 공유된 트리 구조가 성능 향상에 크게 기여할 수 있음을 입증하기 위해.
제안 방법
- 각 리프 노드에 다중 출력을 할당하여, 각 트리가 동시에 다수의 작업을 예측할 수 있도록 하기 위해.
- 부스팅 과정 중에 각 출력(작업)에 대해 작업별 그래디언트를 계산하기 위해.
- 잔차 오차 크기를 고려한 가중 평균 전략을 사용해 모든 작업의 그래디언트를 조합하여 훈련을 안정화하기 위해.
- 결합된 그래디언트를 사용해 트리 구조와 리프 값 업데이트를 수행하면서, 작업 간 공유된 분할을 유지하기 위해.
- LightGBM의 훈련 루프를 수정하여 공유 트리를 활용한 다중 작업 학습을 지원하도록 MT-GBM을 통합하기 위해.
- 잔차 오차의 크기에 기반해 각 작업별로 적응형 학습률 조정을 적용하여 작업 간 수렴 균형을 맞추기 위해.
실험 결과
연구 질문
- RQ1표형 데이터에서 다중 작업 학습을 위한 그래디언트 부스팅에서 공유된 결정 트리 구조를 효과적으로 학습할 수 있는가?
- RQ2잔차 오차 크기가 다른 작업들 간에 다중 작업 그래디언트를 어떻게 조합할 수 있는가? 이는 훈련 안정성을 확보하기 위함이다.
- RQ3작업 간 공유 표현을 학습함으로써 단일 작업 GBDT 모델 대비 주 작업 성능 향상이 이루어지는가?
- RQ4XGBoost, LightGBM와 같은 기존 GBDT 프레임워크에 MT-GBM을 계산 오버헤드 없이 효율적으로 통합할 수 있는가?
- RQ5낮은 상관관계 또는 높은 상관관계를 가진 보조 작업이 MT-GBM의 주 작업 성능에 미치는 영향은 어떠한가?
주요 결과
- 첫 번째 금융 데이터셋에서 MT-GBM은 주 작업의 RMSE를 400.32에서 308.21로 감소시키며 RMSE 23% 향상 및 MAPE를 4.3%에서 3.9%로 감소시켜 9% 향상되었다.
- 사기 탐지 데이터셋에서 네 개의 보조 작업을 사용한 MT-GBM은 평균 ROC-AUC 0.9454를 기록하여 LightGBM(0.9369)과 XGBoost(0.9443)를 모두 능가했다.
- 4개 작업을 포함한 MT-GBM 모델가 가장 높은 성능을 기록하여, 관련성이 높은 다수의 하위 작업을 조합함으로써 강건성과 예측 능력이 향상됨을 시사했다.
- 낮은 상관관계를 가진 작업(예: 상관계수 0.309를 가진 작업 2)이 포함된 경우에도 MT-GBM은 뛰어난 성능을 유지하여 효과적인 지식 전이가 이루어짐을 시사했다.
- 신경망은 동일한 데이터셋에서 빈약한 성능을 보였으며, 이는 이질적인 특성과 노이즈가 많은 입력을 가진 표형 데이터에 대해 MT-GBM이 훨씬 우수함을 보여준다.
- 적응형 학습률을 잔차 오차 크기에 기반해 적용함으로써 안정적인 수렴과 일반화 능력 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.