Skip to main content
QUICK REVIEW

[논문 리뷰] EncT5: Fine-tuning T5 Encoder for Non-autoregressive Tasks

Frederick Liu, Siamak Shakeri|arXiv (Cornell University)|2021. 10. 16.
Topic Modeling참고 문헌 12인용 수 11
한 줄 요약

이 논문은 분류 및 회귀와 같은 비자기적 작업을 위한 사전 훈련된 T5 모델의 인코더만 미세조정하는 EncT5라는 방법을 제안한다. 인코더만을 활용함으로써 EncT5는 전체 T5 모델과 유사한 성능을 달성하면서도 파라미터 수의 50퍼센트 미만으로 구현되어 GLUE 벤치마크에서 높은 효율성을 입증한다.

ABSTRACT

Encoder-decoder transformer architectures have become popular recently with the advent of T5 models. It is also more favorable over architectures like BERT for pre-training on language model task when it comes to large scale models which could take months to train given it's generality. While being able to generalize to more tasks, it is not evident if the proposed encoder-decoder architecture is the most efficient for fine-tuning on classification and regression tasks given the pre-trained model. In this work, we study fine-tuning pre-trained encoder-decoder models such as T5. Particularly, we propose extbf{EncT5} as a way to efficiently fine-tune pre-trained encoder-decoder T5 models for classification and regression tasks by using the encoder layers. Our experimental results show that extbf{EncT5} with less than half of the parameters of T5 performs similarly to T5 models on GLUE benchmark. We believe our proposed approach can be easily applied to any pre-trained encoder-decoder model.

연구 동기 및 목표

  • 사전 훈련된 T5 모델의 인코더만을 미세조정하는 것이 비자기적 작업에서 전체 T5 모델의 성능을 따라할 수 있는지 조사하는 것.
  • 하류 분류 및 회귀 작업을 위한 인코더-디코더 모델(예: T5)의 미세조정에서 파라미터 효율성을 향상시키는 것.
  • 인코더 전용 적응에 초점을 맞춤으로써 사전 훈련된 인코더-디코더 모델 전반에 적용 가능한 일반화 가능한 접근법을 제공하는 것.
  • 계산 비용과 추론 시간을 줄이면서도 표준 벤치마크에서 경쟁 가능한 성능을 유지하는 것.

제안 방법

  • 사전 훈련된 T5 모델의 디코더 및 디코더 어텐션 레이어를 동결하고, 분류 및 회귀 작업을 위해 인코더만 미세조정하는 방법.
  • 입력 시퀀스는 토큰화되어 T5 인코더에 입력되며, 여기서 문맥적 표현이 생성되고 분류 또는 회귀 헤드에 사용된다.
  • 예측을 위해 인코더의 최종 레이어에서 [CLS] 토큰 표현에 분류 또는 회귀 헤드를 부착한다.
  • 각 작업에 맞는 표준 교차 엔트로피 또는 평균 제곱 오차 손실을 사용하여 모델을 엔드 투 엔드로 미세조정한다.
  • 분류 및 회귀 작업의 표준 메트릭을 사용하여 GLUE 벤치마크에서 이 방법을 평가한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 T5 모델의 인코더만을 미세조정하는 것이 비자기적 작업에서 전체 T5 모델의 성능을 따라할 수 있는가?
  • RQ2다양한 GLUE 작업에서 EncT5의 파라미터 효율성은 전체 T5 모델과 비교해 어떻게 되는가?
  • RQ3인코더 전용 적응은 다양한 NLP 작업 간의 일반화 능력을 유지하는가?
  • RQ4이 방법은 T5를 초월한 다른 사전 훈련된 인코더-디코더 모델로 일반화될 수 있는가?

주요 결과

  • EncT5는 파라미터 수의 50퍼센트 미만을 사용하면서도 GLUE 벤치마크에서 전체 T5 모델과 유사한 성능을 달성한다.
  • 인코더 전용 적응은 분류 및 회귀를 포함한 다양한 NLP 작업 간 강력한 일반화 능력을 유지한다.
  • 이 방법은 모델 크기와 미세조정 중 계산 비용을 크게 줄이며 동시에 작업 성능을 유지한다.
  • 이 방법은 이식 가능하며, 최소한의 수정으로도 어떤 사전 훈련된 인코더-디코더 모델에나 적용할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.