Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study on Hyperparameter Optimization for Fine-Tuning Pre-trained Language Models

Xueqing Liu, Chi Wang|arXiv (Cornell University)|2021. 06. 17.
Topic Modeling참고 문헌 32인용 수 5
한 줄 요약

이 논문은 BERT와 RoBERTa를 GLUE 작업에 대해 미세조정할 때 초모수 최적화(HPO) 방법—베이지안 최적화, 랜덤 서치, 조기 정지—를 실증적으로 평가한다. 동일한 시간 예산을 사용함에도 불구하고 HPO는 부족한 예산과 과적합으로 인해 종종 그릿 서치보다 열등하다. 그러나 예산을 확장하고 검색 공간을 축소하는 체계적인 문제 해결 절차를 통해 HPO는 여러 경우에서 그릿 서치를 뛰어넘을 수 있으며, 이는 NLP 미세조정을 위한 HPO에서 신중한 설정과 과적합 완화의 필요성을 강조한다.

ABSTRACT

The performance of fine-tuning pre-trained language models largely depends on the hyperparameter configuration. In this paper, we investigate the performance of modern hyperparameter optimization methods (HPO) on fine-tuning pre-trained language models. First, we study and report three HPO algorithms' performances on fine-tuning two state-of-the-art language models on the GLUE dataset. We find that using the same time budget, HPO often fails to outperform grid search due to two reasons: insufficient time budget and overfitting. We propose two general strategies and an experimental procedure to systematically troubleshoot HPO's failure cases. By applying the procedure, we observe that HPO can succeed with more appropriate settings in the search space and time budget; however, in certain cases overfitting remains. Finally, we make suggestions for future work. Our implementation can be found in https://github.com/microsoft/FLAML/tree/main/flaml/nlp/.

연구 동기 및 목표

  • 동일한 시간 예산 내에서 자동화된 HPO 방법이 전통적인 그릿 서치를 능가할 수 있는지 평가하는 것.
  • 특히 부족한 시간 예산과 과적합으로 인한 NLP 미세조정에서의 HPO 실패 원인을 규명하는 것.
  • 언어 모델 미세조정을 위한 초모수 최적화에서 HPO 실패를 체계적으로 진단하기 위한 실험 절차를 설계하고 검증하는 것.
  • 특히 자원이 적거나 변동성이 큰 NLP 작업에서 실무적으로 HPO 성능을 향상시키기 위한 실질적인 권고 사항을 제공하는 것.

제안 방법

  • 연구는 두 가지 최신 모델(Electra와 RoBERTa)을 대상으로 GLUE 작업에서 세 가지 HPO 방법—베이지안 최적화, 랜덤 서치, 조기 정지—를 평가한다.
  • 각 HPO 방법에 대해 동일한 시간 예산 B를 설정하여 그릿 서치와의 공정한 비교를 보장하며, 이는 D_val에서 모델 학습 및 검증을 포함한다.
  • 검색 공간 S는 초기 학습률, 배치 크기, 가중치 감쇠 등의 핵심 초모수를 기반으로 정의되며, 이는 해당 설정을 샘플링하거나 최적화하는 데 사용된다.
  • 체계적인 문제 해결 절차는 반복적인 검색 공간 정제와 시간 예산 증가를 포함하여 과적합을 줄이고 HPO 성능을 향상시킨다.
  • 평가 프로토콜 f(·)는 검증 정확도(또는 STS-B의 경우 피어슨 상관계수)를 사용하며, 최종 모델 성능은 일반화 능력을 평가하기 위해 D_test에서 테스트된다.
  • 실험은 무작위 시드(42)를 고정하여 확률적 변동성을 제거함으로써 재현성과 공정한 비교를 보장한다.

실험 결과

연구 질문

  • RQ1동일한 시간 예산을 사용할 때 자동화된 HPO 방법이 사전 학습된 언어 모델의 미세조정에서 그릿 서치를 능가할 수 있는가?
  • RQ2어떤 NLP 작업에서 HPO 방법이 그릿 서치보다 우수한 성능을 보이는가?
  • RQ3사전 학습된 언어 모델의 미세조정 맥락에서 HPO 실패의 주요 원인은 무엇인가?
  • RQ4과적합과 부족한 예산을 체계적으로 완화하여 HPO 성능을 향상시킬 수 있는 방법은 무엇인가?
  • RQ5검색 공간 설정은 HPO 성공에 어떤 역할을 하는가? 그리고 이를 모델 및 작업에 따라 최적화하는 방법은 무엇인가?

주요 결과

  • 그릿 서치와 동일한 시간 예산을 사용함에도 불구하고, HPO 방법은 탐색 부족과 검증 세트에 대한 과적합으로 인해 종종 그릿 서치를 능가하지 못한다.
  • 특히 RTE, MRPC, CoLA와 같은 작업에서 학습률과 배치 크기만 검색하는 경우에도 과적합 문제는 끈질리게 지속된다.
  • 모델 및 작업에 특화된 패턴을 바탕으로 시간 예산을 확장하고 검색 공간을 좁힘으로써, HPO는 여러 GLUE 작업에서 그릿 서치를 뛰어넘는다.
  • 랜덤 서치는 예산이 제한된 상황에서도 항상 뛰어난 성능을 보이며, 더 고급 베이지안 최적화나 조기 정지 방법을 뛰어넘거나 이를 따라잡는다.
  • 연구는 기본 그릿 서치 설정이 이미 매우 최적화되어 있어, HPO가 신중한 설정 없이 이를 능가하기 어려운 이유를 규명했다.
  • 제안된 체계적인 문제 해결 절차는 HPO 신뢰도를 크게 향상시키며, 검색 공간 설계가 성공에 결정적인 역할을 한다는 점을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.