Skip to main content
QUICK REVIEW

[논문 리뷰] Scheduled DropHead: A Regularization Method for Transformer Models

Wangchunshu Zhou, Tao Ge|arXiv (Cornell University)|2020. 04. 28.
Topic Modeling참고 문헌 30인용 수 6
한 줄 요약

이 논문은 모델에서 몇몇 헤드가 지배하는 문제를 방지하기 위해 훈련 중에 전체 어텐션 헤드를 무작위로 드롭하는 구조적 드롭아웃 방법인 Scheduled DropHead를 제안한다. 일반화 성능을 향상시키기 위해, 훈련 초반과 후반에 드롭아웃 비율을 높이는 V자형 드롭아웃 비율 스케줄러를 도입하여, 아키텍처 변경 없이 WMT14 En-De 번역 작업에서 0.9 BLEU 향상과 텍스트 분류 작업에서 약 1.0 정확도 향상을 달성한다.

ABSTRACT

In this paper, we introduce DropHead, a structured dropout method specifically designed for regularizing the multi-head attention mechanism, which is a key component of transformer, a state-of-the-art model for various NLP tasks. In contrast to the conventional dropout mechanisms which randomly drop units or connections, the proposed DropHead is a structured dropout method. It drops entire attention-heads during training and It prevents the multi-head attention model from being dominated by a small portion of attention heads while also reduces the risk of overfitting the training data, thus making use of the multi-head attention mechanism more efficiently. Motivated by recent studies about the learning dynamic of the multi-head attention mechanism, we propose a specific dropout rate schedule to adaptively adjust the dropout rate of DropHead and achieve better regularization effect. Experimental results on both machine translation and text classification benchmark datasets demonstrate the effectiveness of the proposed approach.

연구 동기 및 목표

  • 다중 헤드 어텐션 메커니즘에서 몇몇 헤드만 모델 출력에 크게 기여하는 문제를 해결하기 위해.
  • 어텐션 헤드 간의 공진화를 줄임으로써 트랜스포머 모델의 일반화 성능을 향상시키기 위해.
  • 훈련 동적 특성에 민감한 정규화 방법을 설계하여 어テン션 헤드에 대한 구조적 드롭아웃의 효과를 극대화하기 위해.
  • 큰 수의 어텐션 헤드를 제거한 후에도 모델의 강건성과 성능을 향상시키기 위해.

제안 방법

  • DropHead는 개별 유닛이나 연결을 드롭하는 것이 아니라, 훈련 중에 전체 어텐션 헤드를 무작위로 드롭함으로써 구조적 드롭아웃을 적용한다.
  • 각 어텐션 헤드는 고정된 확률로 드롭되며, 이는 모든 헤드가 모델 성능에 기여하도록 유도한다.
  • V자형 드롭아웃 비율 스케줄러를 도입하여 훈련 초반과 후반에 드롭아웃 비율을 높이고 중간에 낮춘다.
  • 헤드 지배 현상이 훈련 초반과 후반에 가장 빈번하게 발생하므로, 이에 기반한 스케줄러 설계이다.
  • 이 방법은 트랜스포머 아키텍처의 인코더-인코더, 인코더-디코더, 디코더-디코더 어텐션 모듈에 적용된다.
  • 이 방법은 아키텍처 변경 없이도 표준 트랜스포머 훈련 파이프라인과 호환된다.

실험 결과

연구 질문

  • RQ1전체 어텐션 헤드에 대한 구조적 드롭아웃이 트랜스포머 모델의 성능과 일반화 성능을 향상시키는가?
  • RQ2훈련 중에 변화하는 동적 드롭아웃 비율 스케줄러가 DropHead의 정규화 효과를 더욱 향상시킬 수 있는가?
  • RQ3Scheduled DropHead는 어텐션 헤드 중요도와 헤드 제거에 대한 모델 강건성에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 번역 및 텍스트 분류와 같은 다양한 NLP 작업에서 성능 향상을 이끌 수 있는가?
  • RQ5V자형 드롭아웃 비율 스케줄러는 일정 또는 선형 변화 스케줄러보다 더 효과적인가?

주요 결과

  • Scheduled DropHead는 표준 트랜스포머 대비 WMT14 En-De 번역 작업에서 0.9 BLEU 포인트 향상시킨다.
  • 여러 텍스트 분류 벤치마크에서 약 1.0 정확도 향상을 달성한다.
  • 인코더-인코더 및 인코더-디코더 어텐션 모듈에 Scheduled DropHead를 적용할 경우 성능 향상이 가장 크다.
  • V자형 드롭아웃 비율 스케줄러는 일정 및 선형(커리큘럼/반-커리큘럼) 스케줄러보다 성능이 뛰어나다.
  • Scheduled DropHead로 훈련된 모델는 큰 수의 어텐션 헤드를 제거한 후에도 성능 유지 능력이 향상되어 강건성이 높아진다.
  • DropHead는 어텐션 헤드 간의 과도한 공진화를 줄이고, 더 많은 헤드가 유용한 정보를 인코딩하도록 유도한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.