Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Deep Transformer with Depth-Scaled Initialization and Merged Attention

Biao Zhang, Ivan Titov|arXiv (Cornell University)|2019. 08. 29.
Natural Language Processing Techniques참고 문헌 35인용 수 5
한 줄 요약

이 논문은 깊은 Transformer 모델에서 학습 안정성과 효율성을 향상하기 위해 깊이 스케일링 초기화(DF-Init)와 통합된 어텐션 하위층(MAtt)을 제안한다. DF-Init는 레이어 깊이에 따라 초기 가중치 분산을 스케일링하여 기울기 소실을 줄인다. MAtt는 평균 기반 자기어텐션과 인코더-디코더 어텐션을 결합하여 병렬 계산을 가능하게 한다. 이 방법은 12층 모델을 사용해 다섯 번의 번역 작업 평균 +1.1 BLEU 향상을 달성했으며, 더 깊은 아키텍처임에도 불구하고 기준 모델과 동일한 디코딩 속도를 유지한다.

ABSTRACT

The general trend in NLP is towards increasing model capacity and performance via deeper neural networks. However, simply stacking more layers of the popular Transformer architecture for machine translation results in poor convergence and high computational overhead. Our empirical analysis suggests that convergence is poor due to gradient vanishing caused by the interaction between residual connections and layer normalization. We propose depth-scaled initialization (DS-Init), which decreases parameter variance at the initialization stage, and reduces output variance of residual connections so as to ease gradient back-propagation through normalization layers. To address computational cost, we propose a merged attention sublayer (MAtt) which combines a simplified averagebased self-attention sublayer and the encoderdecoder attention sublayer on the decoder side. Results on WMT and IWSLT translation tasks with five translation directions show that deep Transformers with DS-Init and MAtt can substantially outperform their base counterpart in terms of BLEU (+1.1 BLEU on average for 12-layer models), while matching the decoding speed of the baseline model thanks to the efficiency improvements of MAtt.

연구 동기 및 목표

  • 학습 중 기울기 소실로 인해 깊은 Transformer 모델에서 수렴이 잘 되지 않는 문제를 해결하기 위해.
  • 모델 성능을 희생시키지 않고 깊은 Transformer의 계산 오버헤드를 줄이기 위해.
  • 아키텍처 및 초기화 수정을 통해 학습 안정성과 효율성을 향상시키기 위해.
  • 더 깊은 Transformer 아키텍처가 번역 작업에서 표준 6층 모델을 능가할 수 있도록 하기 위해.
  • 모델 깊이를 늘리면서도 디코딩 속도를 유지하기 위해.

제안 방법

  • 깊이 스케일링 초기화(DF-Init)는 레이어 깊이 $l$에 따라 초기 가중치 분산을 $1/\sqrt{l}$ 요소로 스케일링하여 잔차 연결의 출력 분산을 줄인다.
  • 통합 어텐션 하위층(MAtt)은 단순화된 평균 기반 자기어텐션 메커니즘과 표준 인코더-디코더 어텐션을 하나의 하위층으로 통합하여 병렬 계산을 가능하게 한다.
  • 단순화된 평균 기반 어텐션은 선형 변환의 수를 줄여 파라미터 수와 계산 비용을 낮춘다.
  • 이 방법은 잔차 연결과 레이어 정규화 구조를 유지하지만, 초기화 단계에서 분산 제어를 통해 기울기 흐름을 안정화시킨다.
  • 실험은 표준 학습 스케줄과 함께 Adam 옵timizer를 사용하며, WMT 및 IWSLT 번역 벤치마크에서 평가된다.
  • 저자원 작업인 IWSLT14 De-En과 같은 경우에 대해 드롭아웃 비율을 증가시켜 학습한다 (dp_a=0.3, dp_r=0.5).

실험 결과

연구 질문

  • RQ1깊은 Transformer는 모델 깊이를 늘림에도 불구하고 수렴이 잘 되지 않는 이유는 무엇인가?
  • RQ2잔차 연결과 레이어 정규화의 상호작용이 기울기 소실에 어떻게 기여하는가?
  • RQ3아키텍처 변경 없이 초기화만으로도 기울기 소실을 완화할 수 있는가?
  • RQ4성능이나 속도를 희생시키지 않고 깊은 Transformer에서 계산 비용을 줄일 수 있는가?
  • RQ5어텐션 하위층을 통합하면 순서-순서 작업에서 학습 효율성과 모델 품질이 향상되는가?

주요 결과

  • DF-Init와 MAtt를 적용한 깊은 Transformer는 12층 모델을 사용해 다섯 번의 번역 작업에서 평균 +1.1 BLEU 향상을 달성한다.
  • 평가된 모든 WMT 및 IWSLT 작업에서 기준 6층 Transformer를 능가하며, 대부분의 방향에서 1.0 BLEU 이상의 향상을 기록한다.
  • WMT18 Zh-En에서 모델은 깊은 인코더를 위한 강력한 기준인 Bapna 등(2018)의 투명 모델보다 +1.58 BLEU 향상을 달성한다.
  • MAtt의 효율성 덕분에 학습 시간이 50% 이상 증가했음에도 불구하고, 디코딩 속도는 기준 모델과 동일하다.
  • IWSLT14 De-En 작업에서 모델은 chrF 점수에서 0.6 포인트 향상하여 서브워드 수준의 정렬이 향상됨을 보여준다.
  • 기울기 노름 분석 결과, DF-Init는 학습 동역학을 안정화시켜 특히 초기 학습 단계에서 기울기 소실을 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.