Skip to main content
QUICK REVIEW

[논문 리뷰] Sequential Training of Neural Networks with Gradient Boosting

Seyedsaman Emami, Gonzalo Martínez-Muñoz|arXiv (Cornell University)|2019. 09. 26.
Machine Learning and ELM인용 수 4
한 줄 요약

이 논문은 경사 부스팅 기반의 새로운 순차적 훈련 방법을 제안하며, 최종 레이어를 반복적으로 추가되는 작은 서브넷(1개 또는 몇 개의 뉴런)을 통해 잔차를 최소화하도록 훈련시킴으로써 신경망을 훈련한다. 이 방법은 Adam 및 L-BFGS와 경쟁 가능한 일반화 성능를 달성하며, 정확도 손실이 크지 않은 범위에서 후행 훈련된 뉴런을 제거함으로써 동적 인퍼런스 속도 제어 기능을 제공한다.

ABSTRACT

This paper presents a novel technique based on gradient boosting to train the final layers of a neural network (NN). Gradient boosting is an additive expansion algorithm in which a series of models are trained sequentially to approximate a given function. A neural network can also be seen as an additive expansion where the scalar product of the responses of the last hidden layer and its weights provide the final output of the network. Instead of training the network as a whole, the proposed algorithm trains the network sequentially in $T$ steps. First, the bias term of the network is initialized with a constant approximation that minimizes the average loss of the data. Then, at each step, a portion of the network, composed of $J$ neurons, is trained to approximate the pseudo-residuals on the training data computed from the previous iterations. Finally, the $T$ partial models and bias are integrated as a single NN with $T imes J$ neurons in the hidden layer. Extensive experiments in classification and regression tasks, as well as in combination with deep neural networks, are carried out showing a competitive generalization performance with respect to neural networks trained with different standard solvers, such as Adam, L-BFGS, SGD and deep models. Furthermore, we show that the proposed method design permits to switch off a number of hidden units during test (the units that were last trained) without a significant reduction of its generalization ability. This permits the adaptation of the model to different classification speed requirements on the fly.

연구 동기 및 목표

  • 경사 부스팅 원리를 활용하여 순차적 방식으로 신경망의 최종 레이어를 훈련시켜 일반화 성능를 향상시키는 방법을 개발하는 것.
  • 마지막에 훈련된 뉴런을 선택적으로 비활성화하여 인퍼런스 중에 동적으로 모델 압축을 가능하게 하는 것.
  • Adam, SGD, L-BFGS와 같은 표준 백프로파게이션 솔버의 대안을 제공하는 것.
  • 작은 서브넷을 반복적으로 훈련시키는 방식이 전체 네트워크 최적화 성능와 경쟁 가능함을 보여주는 것.
  • 신경망 훈련을 위한 경사 부스팅 프레임워크에서 트리 기반 추정기 이외의 기반 추정기(비트리 기반)를 사용할 수 있는지 탐색하는 것.

제안 방법

  • 모델은 평균 훈련 손실을 최소화하는 일정한 근사값으로 초기화된 네트워크 바이어스로 시작한다.
  • T회의 반복 동안, 이전 반복의 예측 결과에서 유도된 가짜 잔차를 맞추기 위해 J개의 뉴런을 가진 작은 서브넷을 훈련한다.
  • 서브넷의 가중치는 잔차의 손실 함수를 최소화하기 위해 뉴턴-라프슨 단계를 사용하여 업데이트된다.
  • 잔차는 다음 반복을 위해 갱신되며, 수렴할 때까지 이 과정을 반복한다.
  • 최종 모델은 T×J개의 히든 유닛을 가진 단일 신경망으로, 모든 순차적으로 훈련된 서브넷을 통합한 것이다.
  • 인퍼런스 중에 마지막에 훈련된 뉴런을 런타임에 비활성화하여 계산 비용을 줄일 수 있으며, 정확도 저하가 최소한이다.

실험 결과

연구 질문

  • RQ1경사 부스팅이 신경망의 최종 레이어를 순차적이고 가감적인 방식으로 효과적으로 훈련시키는 데 적합하게 적용될 수 있는가?
  • RQ2이 순차적 훈련 방식은 Adam 및 L-BFGS와 같은 표준 솔버와 경쟁 가능한 일반화 성능를 달성하는가?
  • RQ3마지막에 훈련된 뉴런을 제거함으로써 인퍼런스 중에 모델을 동적으로 압축할 수 있는가? 성능 저하가 크지 않은가?
  • RQ4이러한 방법의 성능는 분류 및 회귀 작업 전반에서, 특히 타뷸라 데이터 환경에서 어떻게 평가되는가?
  • RQ5이 방법은 전이 학습 시나리오에서 깊은 신경망과 통합될 수 있는가?

주요 결과

  • 제안된 방법은 다양한 분류 및 회귀 작업에서 Adam 및 L-BFGS와 경쟁 가능한 일반화 성능를 달성한다.
  • 회귀 작업에서는 평가된 대부분의 데이터셋에서 최고의 성능를 기록하며, 다른 솔버들을 능가한다.
  • 훈련된 서브넷 수(또는 히든 유닛 수)가 증가함에 따라 모델의 일반화 정확도가 수렴함을 확인하여 안정적인 학습 동역학을 보여준다.
  • 이 방법은 실시간 모델 압축을 가능하게 한다: 마지막에 훈련된 뉴런을 비활성화하면 성능 저하가 최소한이 되어 컴퓨팅 제약 조건에 맞게 런타임에서 적응할 수 있다.
  • 이 방법은 전이 학습 환경에서 깊은 신경망과 조합되어 다양한 아키텍처에서 뛰어난 견고성을 보였다.
  • 작고 집중된 서브넷을 반복적으로 훈련시키는 방식이 강력한 성능를 낼 수 있음을 입증하였으며, 일부 회귀 시나리오에서는 표준 백프로파게이션을 초월하기도 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.