Skip to main content
QUICK REVIEW

[논문 리뷰] Variance-reduced Language Pretraining via a Mask Proposal Network

Liang Chen|arXiv (Cornell University)|2020. 08. 12.
Topic Modeling참고 문헌 24인용 수 9
한 줄 요약

이 논문은 자기지도 학습 언어 사전학습에서 기울기 분산을 줄이기 위해 균일한 무작위 마스킹 대신 정보성 있는 마스킹 위치를 샘플링하는 데에 초점을 맞춘 MAP-Net이라는 마스크 제안 네트워크를 제안한다. 기울기 노름에 비례하는 중요도 샘플링 분포를 근사함으로써, MAP-Net은 수렴 속도를 가속화하고 성능을 향상시켜 GLUE 벤치마크에서 BERT의 1000k 스텝 대비 600k 스텝 만에 BERT 수준의 정확도를 달성한다.

ABSTRACT

Self-supervised learning, a.k.a., pretraining, is important in natural language processing. Most of the pretraining methods first randomly mask some positions in a sentence and then train a model to recover the tokens at the masked positions. In such a way, the model can be trained without human labeling, and the massive data can be used with billion parameters. Therefore, the optimization efficiency becomes critical. In this paper, we tackle the problem from the view of gradient variance reduction. In particular, we first propose a principled gradient variance decomposition theorem, which shows that the variance of the stochastic gradient of the language pretraining can be naturally decomposed into two terms: the variance that arises from the sample of data in a batch, and the variance that arises from the sampling of the mask. The second term is the key difference between selfsupervised learning and supervised learning, which makes the pretraining slower. In order to reduce the variance of the second part, we leverage the importance sampling strategy, which aims at sampling the masks according to a proposal distribution instead of the uniform distribution. It can be shown that if the proposal distribution is proportional to the gradient norm, the variance of the sampling is reduced. To improve efficiency, we introduced a MAsk Proposal Network (MAPNet), which approximates the optimal mask proposal distribution and is trained end-to-end along with the model. According to the experimental result, our model converges much faster and achieves higher performance than the baseline BERT model.

연구 동기 및 목표

  • 균일한 무작위 마스킹의 비효율성으로 인해 기울기 분산이 커지고 수렴 속도가 느려지는 자기지도 학습 언어 사전학습 문제를 해결하기 위해.
  • 사전학습 중 기울기 분산을 데이터 배치와 마스크 샘플링 성분으로 공식적으로 분해하여, 후자를 줄이기 위해.
  • 정보성 있고 영향력 있는 마스킹 위치를 샘플링하는 것을 학습하는, 미분 가능하고 종단 간 훈련이 가능한 마스크 제안 네트워크(MAP-Net)를 설계하기 위해.
  • 추가적인 레이블 데이터가 필요 없이 최적화 분산을 줄임으로써 사전학습 효율성과 다운스트림 성능을 향상시키기 위해.
  • 분산 감소 사전학습이 표준 NLP 벤치마크에서 더 빠른 수렴과 더 높은 정확도를 가능하게 함을 보여주기 위해.

제안 방법

  • 기울기 분산을 공식적으로 분해하는 정립된 정리 제안: 기울기 분산을 데이터 배치와 마스크 샘플링 성분으로 분리.
  • 기울기 노름에 비례하는 최적의 마스크 샘플링 확률을 갖는 중요도 샘플링 전략을 도입.
  • 문장 입력을 받아 마스크 샘플링을 위한 위치에 대한 확률 분포를 출력하는 신경망으로 MAP-Net 설계.
  • 모델 손실을 기울기 노름의 대체 지표로 사용하여 마스크 선택을 안내하는 방식으로, MAP-Net과 주 모델을 함께 적대적으로 훈련.
  • 강화 학습을 피하기 위해 상대적 성능 기반의 페어와이즈 선호 학습을 활용해 MAP-Net을 최적화.
  • MAP-Net이 어려운 마스크를 생성하여 높은 손실를 유도하도록 분리된 훈련 목표를 사용함으로써, 모델이 더 깊은 표현을 학습하도록 유도.

실험 결과

연구 질문

  • RQ1언어 사전학습에서 기울기 분산을 데이터 샘플링과 마스크 샘플링 성분과 관련된 명시적인 성분들로 공식적으로 분해할 수 있는가?
  • RQ2비균일한 중요도 샘플링 마스크 분포를 사용하면 최적화 분산이 감소하고 자기지도 사전학습에서 수렴 속도가 가속화되는가?
  • RQ3학습 가능한 마스크 제안 네트워크(MAP-Net)가 마스크 샘플링을 위한 최적의 중요도 분포를 효과적으로 근사할 수 있는가?
  • RQ4MAP-Net을 사용한 훈련이 BERT의 균일한 마스킹 대비 더 빠른 수렴과 향상된 다운스트림 성능을 보이는가?
  • RQ5MAP-Net은 의미적으로 의미 있는 정보성 있는 마스킹 토큰, 예를 들어 콘텐츠가 풍부한 단어와 형태변형어를 효과적으로 선택할 수 있는가?

주요 결과

  • MAP-Net은 정보성 있는 마스크 위치를 샘플링함으로써 사전학습 중 기울기 분산을 크게 줄여 수렴 속도를 가속화한다.
  • MAP-Net을 사용해 훈련한 모델는 800k 스텝에서 GLUE 평균 점수 82.11을 기록했으며, BERT의 1000k 스텝에서의 81.68 점수를 초월한다.
  • MAP-Net 모델의 600k 체크포인트 성능이 BERT의 1000k 체크포인트 성능과 동일하여, 동일한 성능를 달성하기 위한 학습 스텝 수를 25% 감소시킴을 보여준다.
  • 시각화 결과는 MAP-Net이 명사와 동사와 같은 콘텐츠 단어를 우선적으로 마스킹하고, 예를 들어 'computer', 'computing', 'computation'과 같은 단어 변형어를 중복 마스킹하는 것을 피하는 것으로 나타났으며, 이는 더 깊은 맥락적 학습을 촉진한다.
  • 이 방법은 사전학습 비용과 에너지 소비를 줄여 계산 자원 낭비를 최소화함으로써 환경 지속 가능성에 기여한다.
  • 이 방법은 RTE, SST-2, QNLI 및 전체 GLUE 벤치마크에서 일관된 향상 효과를 보이며, 다양한 다운스트림 작업에 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.