Skip to main content
QUICK REVIEW

[논문 리뷰] Fusing finetuned models for better pretraining

Leshem Choshen, Elad Venezian|arXiv (Cornell University)|2022. 04. 06.
Machine Learning and Algorithms인용 수 12
한 줄 요약

이 논문은 여러 개의 피니튜닝된 모델의 가중치를 평균화하여 다운스트림 작업을 위한 우수한 베이스 모델을 생성하는 방법을 제안한다. 이 방법은 표준 미리 훈련 및 상호 훈련보다 뛰어난 성능을 내며, 계산 비용을 최소화하면서도 정확도와 안정성이 높다. 특히 가중치 감쇠에 대해 매우 강건하다.

ABSTRACT

Pretrained models are the standard starting point for training. This approach consistently outperforms the use of a random initialization. However, pretraining is a costly endeavour that few can undertake. In this paper, we create better base models at hardly any cost, by fusing multiple existing fine tuned models into one. Specifically, we fuse by averaging the weights of these models. We show that the fused model results surpass the pretrained model ones. We also show that fusing is often better than intertraining. We find that fusing is less dependent on the target task. Furthermore, weight decay nullifies intertraining effects but not those of fusing.

연구 동기 및 목표

  • 미리 훈련하는 데 드는 높은 비용을 줄이기 위해, 새로 훈련하는 대신 기존에 피니튜닝된 모델을 재사용하는 것.
  • 추가적인 미리 훈련 없이도 다운스트림 작업을 위한 베이스 모델 품질을 향상시키는 것.
  • 여러 개의 피니튜닝된 모델을 융합하면 단일 모델의 상호 훈련보다 더 나은 초기화를 얻을 수 있는지 탐색하는 것.
  • 가중치 감쇠와 같은 초모수 설정에 대한 융합의 강건성 평가.
  • 기존 전이 학습 파라다임을 뒤집어, 피니튜닝된 모델을 사용하여 더 나은 미리 훈련된 모델을 만드는 것.

제안 방법

  • 융합는 여러 개의 피니튜닝된 모델의 가중치를 평균화하여 새로운 베이스 모델을 생성하는 것으로 정의된다.
  • 융합 모델은 $ W_{fuse} = \frac{1}{n} \sum_{i=1}^{n} W_i $ 로 초기화되며, 여기서 $ W_i $ 는 $ i $-번째 피니튜닝된 모델의 가중치이다.
  • 이 방법은 다양한 소스 작업에서 유래한 기존의 피니튜닝된 모델을 활용하여, 더 향상된 새로운 베이스 모델을 초기화하는 데 쓰인다.
  • 실험은 일반(General, GLUE/SuperGLUE), NLI, Twitter 세 가지 가족의 30개 데이터셋에서 표준 미리 훈련 및 상호 훈련과의 비교를 통해 수행된다.
  • 가중치 감쇠는 피니튜닝 중 적용되어 융합과 상호 훈련의 성능에 미치는 영향을 평가한다.
  • 정확도와 표준편차를 측정하여 성능 및 훈련 안정성의 두 가지 측면을 평가한다.

실험 결과

연구 질문

  • RQ1여러 개의 피니튜닝된 모델을 융합하면 표준 미리 훈련보다 더 나은 베이스 모델을 만들 수 있는가?
  • RQ2동일한 소스 모델을 사용할 때 융합이 상호 훈련보다 일관되게 우수한 성능을 내는가?
  • RQ3가중치 감쇠는 융합과 상호 훈련의 성능에 어떻게 영향을 미치는가?
  • RQ4융합은 피니튜닝된 모델의 소스 작업과 도메인의 선택에 대해 강건한가?
  • RQ5다양한 작업에서 피니튜닝된 모델을 융합하면 더 일반화 가능한 베이스 모델이 만들어지는가?

주요 결과

  • T5에서 30개의 데이터셋 전반에 걸쳐 피니튜닝된 모델을 융합하는 것은 표준 미리 훈련을 항상 능가하며, 더 높은 정확도와 낮은 분산을 기록한다.
  • 최상의 두 개의 피니튜닝된 모델을 융합했을 때 상호 훈련보다 더 뛰어난 성능을 기록했으며, NLI에서 평균 1.61% 향상, Twitter에서 평균 2.27% 향상되었다.
  • 융합 모델의 표준편차는 미리 훈련된 베이스 모델에서 피니튜닝한 것보다 항상 낮아, 훈련 안정성이 향상됨을 시사한다.
  • 가중치 감쇠는 상호 훈련 성능을 심각하게 떨어뜨렸지만, 융합에는 거의 영향을 주지 않아 융합의 강건성을 보여준다.
  • 융합는 특정 타겟 작업에 크게 의존하지 않으며, 다양한 NLP 벤치마크에서 더 강한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.