Skip to main content
QUICK REVIEW

[논문 리뷰] Masking as an Efficient Alternative to Finetuning for Pretrained Language Models

Mengjie Zhao, Tao Lin|arXiv (Cornell University)|2020. 04. 26.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 미세조정의 파rameter 효율적인 대안으로 사전 훈련된 언어 모델 가중치에 대해 선택적 이진 마스크를 학습하는 마스킹을 제안한다. 사전 훈련된 가중치를 유지하면서 각 작업에 대해 1비트 마스크만 훈련함으로써, 11개의 NLP 작업 전반에서 미세조정과 유사한 성능를 달성하면서 메모리 사용을 크게 줄인다. 특히 다중 작업 배포에 있어 효과적이다.

ABSTRACT

We present an efficient method of utilizing pretrained language models, where we learn selective binary masks for pretrained weights in lieu of modifying them through finetuning. Extensive evaluations of masking BERT and RoBERTa on a series of NLP tasks show that our masking scheme yields performance comparable to finetuning, yet has a much smaller memory footprint when several tasks need to be inferred simultaneously. Through intrinsic evaluations, we show that representations computed by masked language models encode information necessary for solving downstream tasks. Analyzing the loss landscape, we show that masking and finetuning produce models that reside in minima that can be connected by a line segment with nearly constant test accuracy. This confirms that masking can be utilized as an efficient alternative to finetuning.

연구 동기 및 목표

  • 동시에 여러 작업을 배포할 때 대규모 사전 훈련된 언어 모델의 미세조정으로 인한 높은 메모리 비용을 해결하기 위해.
  • 사전 훈련된 가중치를 업데이트하지 않고도 이진 마스크를 통한 선택적 파ram터 프루닝이 미세조정 성능을 따라잡을 수 있는지 탐색하기 위해.
  • 다양한 NLP 작업에서 마스킹이 미세조정의 파ram터 효율적인 대안으로 얼마나 효과적인지 평가하기 위해.
  • 마스킹이 경쟁적으로 성능를 내는 이유를 이해하기 위해 마스킹 모델의 일반화성과 손실 곡면 성질을 분석하기 위해.

제안 방법

  • 해당 방법은 각 최종 작업에 대해 사전 훈련된 모델의 어텐션 및 피드포워드 레이어에 적용되는 학습 가능한 이진 마스크 세트를 훈련한다.
  • 이진 마스크는 이산적인 마스크 값에 대한 역전파를 가능하게 하기 위해 스트레이트스루 추정기를 사용하여 종단 간 최적화된다.
  • 최종 모델은 오직 마스킹된 가중치(즉, 원본 사전 훈련된 가중치에 이진 마스크를 곱한 것)만 사용하며, 모든 원본 파ram터는 그대로 유지된다.
  • 이 방법은 BERT, RoBERTa, DistilBERT를 사용하여 시퀀스 분류, NER, 독해 이해 등 11개의 다양한 NLP 작업에 적용된다.
  • 모델의 파라미터 효율적인 앙상블을 위해, 전체 미세조정된 가중치가 아닌 오직 이진 마스크만 저장함으로써 가능해진다.
  • 손실 곡면 유사성을 평가하기 위해, 미세조정된 모델과 마스킹된 모델을 직선 세그먼트를 따라 보간함으로써 모드 연결성 분석을 수행한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 가중치에 대해 이진 마스크를 학습하는 것이 다양한 NLP 작업에서 전체 미세조정 성능와 유사한 성능를 달성할 수 있는가?
  • RQ2여러 하위 작업을 동시에 배포할 때 마스킹의 메모리 효율성은 미세조정과 비교해 어떻게 되는가?
  • RQ3마스킹된 모델이 학습한 표현들이 하위 작업 성능에 충분한 정보를 담고 있는가?
  • RQ4마스킹과 미세조정이 손실 곡면에서 발견한 최소값들이 선분을 따라 연결되어 있는가? 이는 유사한 최적화 경로를 의미하는가?
  • RQ5다양한 모델과 작업 간 마스킹 메커니즘의 성능에 영향을 주는 요소는 무엇인가?

주요 결과

  • 마스킹은 MRPC, SST-2, CoNLL-2003를 포함한 11개의 다양한 NLP 작업에서 미세조정과 유사한 성능를 달성하며, 정확도에 유의미한 하락이 없음을 확인했다.
  • 마스킹의 메모리 프로파일은 극적으로 감소했으며, 작업당 파라미터당 1비트에 불과하여 엣지 디바이스에서의 다중 작업 배포에 이상적이다.
  • 내재적 평가 결과, 마스킹된 모델가 하위 작업에 적합하고 일반화 가능한 정보를 담은 표현을 추출함을 확인했다.
  • 손실 곡면 분석 결과, 마스킹과 미세조정이 발견한 최소값들이 거의 일정한 테스트 정확도를 유지하는 선분을 따라 연결되어 있으며, 이는 유사한 최적화 품질을 의미한다.
  • 더 깊은 BERT 레이어의 마스크는 작업 간에 더 상이한 편향을 보이며, 이는 더 깊은 레이어에서 작업 특화성이 더 높다는 것을 시사하며, 이는 미세조정 연구 결과와 일치한다.
  • 다른 무작위 초기화를 가진 마스크들 역시 비슷한 성능를 보이며, 이는 여러 개의 효과적인 하위네트워크가 존재함을 지지하며, 라이킷 티켓 가설과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.