Skip to main content
QUICK REVIEW

[논문 리뷰] Position Masking for Language Models

Andy Wagner, Tiyasa Mitra|arXiv (Cornell University)|2020. 06. 02.
Topic Modeling참고 문헌 5인용 수 4
한 줄 요약

이 논문은 BERT 유사 모델에서 마스킹된 토큰의 위치를 추가로 마스킹하고 예측하기 위해 전용 분류기 헤드를 사용하는 새로운 방법인 위치 마스킹(position masking)을 제안한다. 이 방법은 학습 수렴 속도와 성능을 향상시키며, SQuAD에서 F1 점수 0.3%p 향상 및 IPU 하드웨어에서 원래 BERT 학습 토큰 수의 50% 수준으로 수렴 시간을 단축시킨다. 또한 드롭아웃 층을 통한 기울기 흐름을 향상시켜 더 빠른 수렴을 가능하게 한다.

ABSTRACT

Masked language modeling (MLM) pre-training models such as BERT corrupt the input by replacing some tokens with [MASK] and then train a model to reconstruct the original tokens. This is an effective technique which has led to good results on all NLP benchmarks. We propose to expand upon this idea by masking the positions of some tokens along with the masked input token ids. We follow the same standard approach as BERT masking a percentage of the tokens positions and then predicting their original values using an additional fully connected classifier stage. This approach has shown good performance gains (.3\% improvement) for the SQUAD additional improvement in convergence times. For the Graphcore IPU the convergence of BERT Base with position masking requires only 50\% of the tokens from the original BERT paper.

연구 동기 및 목표

  • 마스크된 토큰의 위치 예측을 추가로 포함한 마스킹된 언어 모델링(MLM)의 확장으로 BERT 스타일 모델의 학습 효율성과 성능을 향상시키는 것.
  • 위치 마스킹을 추가했을 때 트랜스포머 기반 언어 모델에서 수렴 속도 향상과 더 나은 일반화 성능이 유도되는지 조사하는 것.
  • 위치 마스킹이 마스킹된 언어 모델링(MLM) 사전학습 및 이후 SQuAD 미세조정 작업에 미치는 영향을 평가하는 것.
  • 드롭아웃 층을 통한 수정된 기울기 흐름이 모델 성능에 미치는 영향을 탐색하는 것.
  • 동일한 학습 제약 조건 하에서 GPU 및 IPU 하드웨어 플랫폼 간의 학습 효율성과 정확도를 비교하는 것.

제안 방법

  • 표준 토큰 재구성 헤드 외에, 마스킹된 토큰의 원래 위치를 예측하기 위한 새로운 완전 연결 분류기 헤드를 추가한다.
  • 모델은 BERT와 동일한 마스킹 전략을 사용한다: 90%의 토큰이 마스킹되며, 5%는 정확한 위치를 사용하고 5%는 무작위 위치를 사용한다.
  • 위치 마스킹은 토큰 마스킹 외에도 적용되어 위치 인코딩 학습을 위한 추가적인 감독 신호를 제공한다.
  • 아키텍처는 표준 BERT 사전학습 목표를 사용하며, 시퀀스 길이 128 및 384를 사용하고, 파이프라인 IPU 구현을 통해 학습된다.
  • 개선된 드롭아웃 기울기 기법이 도입되며, 이는 역전파 동안 드롭아웃 마스크가 적용되지 않아 미세조정 성능을 향상시킨다.
  • 실험은 GPU 및 IPU 플랫폼 모두에서 수행되며, 기준 모델로 BERT Base를 사용하고 SQuAD를 주요 평가 지표로 삼는다.

실험 결과

연구 질문

  • RQ1BERT 유사 모델에서 토큰 값 외에 토큰 위치까지 마스킹하면 수렴 속도와 최종 모델 성능이 향상되는가?
  • RQ2위치 마스킹은 트랜스포머 모델에서 위치 임베딩 학습에 어느 정도 기여하는가?
  • RQ3개선된 드롭아웃 기울기 기법은 표준 드롭아웃 대비 미세조정 성능에 어떤 영향을 미치는가?
  • RQ4특수 하드웨어인 IPU에서 수렴에 필요한 학습 토큰 수를 줄일 수 있는가?
  • RQ5F1 점수 및 수렴 시간 측면에서 IPU 대비 GPU 플랫폼에서 위치 마스킹의 상대적 성능 향상은 어떠한가?

주요 결과

  • IPU에서 표준 BERT 학습 대비 SQuAD v1.1 F1 점수는 0.3%p 향상되고, EM 점수는 0.4%p 향상되었다.
  • IPU에서 원래 BERT 논문의 토큰 수 대비 50% 수준으로 수렴 시간이 단축되었으며, 위치 마스킹 덕분에 더 빠른 수렴이 가능했다.
  • GPU 결과에서는 SQuAD에서 F1 점수 0.3%p 향상되었으며, IPU 결과와 일관되게 나타났다. 다만 시퀀스 길이 제약 조건으로 인해 최고 성능에 도달하지 못했다.
  • 10% 위치 마스킹 비율에서 가장 우수한 성능를 기록했으며, 15% 마스킹 비율은 마스킹 없음과 유사한 결과를 보였고, 5% 마스킹 비율도 10%와 유사한 성능 향상을 보였다.
  • 개선된 드롭아웃 기울기 기법은 표준 드롭아웃 대비 SQuAD 성능을 0.5%p 향상시켜 잠재적인 정규화 효과를 시사한다.
  • IPU는 수렴 속도와 안정 상태 성능 모두에서 GPU를 능가했으며, 위치 마스킹을 사용할 경우 10% 더 빠른 수렴을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.