[논문 리뷰] RomeBERT: Robust Training of Multi-Exit BERT
RomeBERT는 성능 불균형을 완화하기 위해 기울기 정규화된 자기 분산 학습을 사용하는 다중 출구 BERT를 위한 강력한 훈련 프레임워크를 제안한다. 일괄적인 단계에서 BERT 기반 모델과 다중 분류기를 함께 훈련함으로써 RomeBERT는 뛰어난 속도-성능 트레이드오프를 달성하며, GLUE 벤치마크에서 DeeBERT와 FastBERT를 능가한다. 이는 기준 모델의 정확도를 유지하면서도 추론 시간을 최대 65.2% 감소시킨다.
BERT has achieved superior performances on Natural Language Understanding (NLU) tasks. However, BERT possesses a large number of parameters and demands certain resources to deploy. For acceleration, Dynamic Early Exiting for BERT (DeeBERT) has been proposed recently, which incorporates multiple exits and adopts a dynamic early-exit mechanism to ensure efficient inference. While obtaining an efficiency-performance tradeoff, the performances of early exits in multi-exit BERT are significantly worse than late exits. In this paper, we leverage gradient regularized self-distillation for RObust training of Multi-Exit BERT (RomeBERT), which can effectively solve the performance imbalance problem between early and late exits. Moreover, the proposed RomeBERT adopts a one-stage joint training strategy for multi-exits and the BERT backbone while DeeBERT needs two stages that require more training time. Extensive experiments on GLUE datasets are performed to demonstrate the superiority of our approach. Our code is available at https://github.com/romebert/RomeBERT.
연구 동기 및 목표
- 다중 출구 BERT에서 조기 출구가 후기 출구에 비해 성능이 현저히 열등한 성능 불균형 문제를 해결하기 위해.
- BERT 기반 모델과 다중 출구 분류기를 함께 훈련하기 위해 이중 단계 훈련이 필요 없도록 하기 위해.
- 강력한 훈련 기법을 통해 최종 출구 정확도를 떨어뜨리지 않고도 조기 출구 성능을 향상시키기 위해.
- DeeBERT나 FastBERT와 같은 기존 방법보다 더 나은 효율-성능 트레이드오프를 달성하기 위해.
- BERT 기반 모델의 고정을 피하고 모델 표현력을 유지하기 위해 일단계, 통합된 훈련을 가능하게 하기 위해.
제안 방법
- GEM과 기울기 수술(Gradient Surgery)에서 영감을 얻은 기울기 정규화(GR)를 도입하여 조기 및 후기 출구 간 기울기를 균형 잡고 훈련 갈등을 감소시킨다.
- 최종 출구에서 조기 출구로 소프트 레이블 지식을 전달하기 위해 자기 분산 학습(SD)을 활용하여 일관성과 조기 출구 성능 향상을 촉진한다.
- BERT 기반 모델과 모든 다중 출구 분류기를 일괄적인 단계에서 함께 훈련하여 DeeBERT의 이중 단계 미세조정을 피한다.
- 최종 출구에는 교차 엔트로피 손실을, 조기 출구에는 분산 손실을 사용하며, GR을 적용해 기울기 갱신을 안정화시킨다.
- 최종 분류기에서 모든 중간 분류기로 소프트 레이블 분산을 적용하여 출구 레이어 간 예측을 일치시킨다.
- 백프로파게이션 중 갈등하는 기울기를 제약하는 새로운 기울기 정규화 기법을 도입하여, 특히 다중 출구 환경에서 매우 중요한 안정성 향상을 달성한다.
실험 결과
연구 질문
- RQ1자기 분산 학습은 최종 출구 정확도를 떨어뜨리지 않고도 다중 출구 BERT의 조기 출구 성능을 향상시킬 수 있는가?
- RQ2BERT 기반 모델과 다중 출구 분류기를 함께 훈련하는 일단계 통합 훈련이 고정된 BERT를 사용한 이중 단계 미세조정을 능가하는가?
- RQ3기울기 정규화는 다중 출구 BERT에서 기울기 갈등을 효과적으로 줄이고 훈련 안정성을 향상시킬 수 있는가?
- RQ4DeeBERT와 FastBERT와 비교해 RomeBERT는 다양한 NLP 작업에서 추론 효율성과 정확도 트레이드오프 측면에서 어떻게 성과를 내는가?
- RQ5RomeBERT에서는 이전 레이어로의 출구 레이어 분포가 이전 방법들에 비해 얼마나 더 앞서는가?
주요 결과
- RTE 데이터셋에서 RomeBERT는 69.5%의 정확도를 달성했으며, BERT-base보다 0.1% 높고 기대 실행 시간을 10.6% 감소시켰다. 이는 정확도와 효율성 양면에서 DeeBERT와 DeeBERT+SD를 모두 능가한다.
- QNLI에서 RomeBERT는 기대 실행 시간의 34.1%만으로 88.7%의 정확도를 달성했으며, DeeBERT는 15.2% 더 많은 시간을 소비하고 87.1%의 정확도를 기록했다.
- QQP에서 RomeBERT는 BERT-base 대비 65.2%의 시간 절감을 이룬 70.8%의 F1 스코어를 기록했으며, DeeBERT는 동일한 성능을 달성하기 위해 20.1% 더 많은 시간이 소요되었다.
- 34.1%의 실행 시간으로 제약을 둘 경우, RomeBERT는 88.7%의 정확도를 유지하지만, DeeBERT는 82.4%로 하락하고 DeeBERT+SD는 81.7%로 떨어진다.
- RomeBERT의 출구 레이어 분포는 기존 방법들에 비해 상당히 앞선 레이어 쪽으로 기울어져 있다 (SST-2에서 1단계 레이어가 60%의 경우에서 발생함). 이는 DeeBERT 및 DeeBERT+SD보다 더 강력한 조기 출구 능력을 지닌 것으로 나타났다.
- 제거 실험 결과, 기울기 정규화가 모든 레이어에서 성능 향상을 이끌었으며, 특히 RTE와 QNLI에서 뚜렷한 향상이 있었고, QQP와 MNLI의 조기 레이어에서는 최대 20%의 성능 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.