[논문 리뷰] Early Exiting with Ensemble Internal Classifiers
이 논문은 앙상블 학습과 정보 이론을 활용하여 내부 분류기의 다양성과 정확도를 동시에 최적화하는 새로운 학습 목표와 투표 기반 추론 전략을 제안한다. 이는 사전 훈련된 언어 모델에서의 조기 종료를 위한 것으로, 이전 방법들보다 더 나은 정확도-속도 트레이드오프를 달성하며, ALBERT에서 최대 82.4%의 정확도를 2.0× 속도 향상으로 달성한다.
As a simple technique to accelerate inference of large-scale pre-trained models, early exiting has gained much attention in the NLP community. It allows samples to exit early at internal classifiers without passing through the entire model. Most existing work usually trains the internal classifiers independently and employs an exiting strategy to decide whether or not to exit based on the confidence of the current internal classifier. However, none of these works takes full advantage of the fact that the internal classifiers are trained to solve the same task therefore can be used to construct an ensemble. In this paper, we show that a novel objective function for the training of the ensemble internal classifiers can be naturally induced from the perspective of ensemble learning and information theory. The proposed training objective consists of two terms: one for accuracy and the other for the diversity of the internal classifiers. In contrast, the objective used in prior work is exactly the accuracy term of our training objective therefore only optimizes the accuracy but not diversity. Further, we propose a simple voting-based strategy that considers predictions of all the past internal classifiers to infer the correct label and decide whether to exit. Experimental results on various NLP tasks show that our proposed objective function and voting-based strategy can achieve better accuracy-speed trade-offs.
연구 동기 및 목표
- 기존의 조기 종료 방법들이 내부 분류기 간의 다양성을 고려하지 않고 정확도만 최적화하는 데서 비효율적인 문제를 해결한다.
- 조기 종료를 앙상블 학습 문제로 모델링하여 추론 속도와 정확도를 향상시킨다.
- 정보 이론을 사용하여 정확도와 내부 분류기의 다양성을 균형 잡는 새로운 학습 목표를 개발한다.
- 모든 이전 내부 분류기의 예측을 활용하여 종료 결정을 내리는 투표 기반 종료 전략을 제안한다.
- DistilBERT나 LayerDrop과 같은 최신 기법들보다 여러 NLP 벤치마크에서 더 나은 정확도-속도 트레이드오프를 달성한다.
제안 방법
- 다양한 레이어의 내부 분류기를 조합하여 예측 신뢰도를 향상시키는 앙상블 학습 문제로 조기 종료를 공식화한다.
- 두 항목으로 구성된 새로운 손실 함수를 제안한다: 하나는 정답의 가능도를 최대화하는 정확도 항, 다른 하나는 분류기 예측 간 상호정보량을 최소화하는 다양성 항.
- 정보 이론을 사용하여 내부 분류기의 조합 예측과 진짜 레이블 간의 상호정보량에 하한을 도출하고, 이 하한을 손실 함수가 최적화한다.
- 다양성 정규화를 위해 동적 소프트 레이블 타겟 {1−λpc, λpc}을 도입하며, 이는 레이어별로 적응적인 레이블 스무딩과 유사하다.
- 이전에 통과한 모든 내부 분류기의 예측을 집계하여 최종 레이블을 추론하고 종료 여부를 결정하는 투표 기반 종료 전략을 설계한다.
- 제안된 손실 함수와 전략을 BERT, ALBERT 등의 백본 모델과 통합하여 플러그 앤 플레이 방식의 배포를 가능하게 한다.
실험 결과
연구 질문
- RQ1내부 분류기의 정확도와 다양성을 동시에 최적화하는 것이 조기 종료 성능을 향상시킬 수 있는가?
- RQ2제안된 정보 이론 기반 손실 함수는 일반화 성능과 정확도-속도 트레이드오프 측면에서 표준 크로스 엔트로피 손실 함수보다 어떻게 비교되는가?
- RQ3모든 이전 내부 분류기의 예측을 활용하는 투표 기반 종료 전략이 신뢰도 기반 또는 내성 기반 전략보다 우월한가?
- RQ4다양한 모델과 데이터셋에서 하이퍼파라미터(λ 및 k)의 선택에 대해 제안된 방법이 얼마나 강인한가?
- RQ5다양성 정규화가 사전 훈련된 모델의 깊은 레이어에서의 과도한 확신을 얼마나 줄이는가?
주요 결과
- 제안된 방법은 ALBERT에서 다중 클래스 텍스트 분류 작업에서 2.0× 속도 향상으로 95.2%의 정확도와 82.4%의 F1 스코어를 달성하며, PABEE나 DistilBERT와 같은 이전 방법들을 능가한다.
- SST-2 개발 세트에서 제안된 손실 함수와 투표 전략을 사용한 모델는 2.0× 속도 향상으로 97.0%의 정확도를 기록하며, 정확도 측면에서 오라클 기준선을 초월하면서도 더 빠르게 작동한다.
- 절단 실험 결과 λ = 0.2일 때가 가장 우수한 정확도-속도 트레이드오프를 보이며, λ = 0(다양성 손실 제거)로 설정할 경우 성능이 가장 열 劣하다.
- 1.4× 이하의 속도 향상 비율에서 투표 기반 전략은 내성 기반 및 엔트로피 기반 전략보다 일관되게 우수한 성능을 보이며, 조기 종료 결정의 효과성을 입증한다.
- 실험 분석을 통해 다양성 정규화가 깊은 레이어에서 타겟을 부드럽게 하여 과도한 확신을 줄이고 일반화 성능을 향상시킴을 확인하였다.
- 다양성 손실은 주로 예측이 가장 높은 상관관계를 보이는 인접 레이어에 영향을 미치며, 이는 상호 레이어 간 다양성을 촉진하는 데 효율적임을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.