Skip to main content
QUICK REVIEW

[논문 리뷰] DeepNet: Scaling Transformers to 1,000 Layers

Hongyu Wang, Shuming Ma|arXiv (Cornell University)|2022. 03. 01.
Neural Networks and Reservoir Computing인용 수 54
한 줄 요약

DEEPNET은 잔차 연결의 정규화 DEEPNORM을 도입하여 모델 업데이트를 경계하고, 최대 1,000층까지 Transformer 깊이를 가능하게 하며 강력한 다국어 MT 성능을 달성한다.

ABSTRACT

In this paper, we propose a simple yet effective method to stabilize extremely deep Transformers. Specifically, we introduce a new normalization function (DeepNorm) to modify the residual connection in Transformer, accompanying with theoretically derived initialization. In-depth theoretical analysis shows that model updates can be bounded in a stable way. The proposed method combines the best of two worlds, i.e., good performance of Post-LN and stable training of Pre-LN, making DeepNorm a preferred alternative. We successfully scale Transformers up to 1,000 layers (i.e., 2,500 attention and feed-forward network sublayers) without difficulty, which is one order of magnitude deeper than previous deep Transformers. Remarkably, on a multilingual benchmark with 7,482 translation directions, our 200-layer model with 3.2B parameters significantly outperforms the 48-layer state-of-the-art model with 12B parameters by 5 BLEU points, which indicates a promising scaling direction.

연구 동기 및 목표

  • 최대 1,000층에 이르는 극단적인 깊이로 확장할 때 트랜스포머 모델의 학습 불안정성을 동기부여하고 해결한다.
  • 모델 업데이트를 바운딩하고 최적화를 안정시키는 간단한 정규화 및 초기화 스킴(DEEPNORM)을 제안한다.
  • 다양한 기계 번역 벤치마크에서 안정성과 성능 향상을 보여주며, 다국어 설정을 포함한다.
  • 인코더-전용, 디코더-전용, 인코더-디코더 모델에 대한 실용적인 초기화 및 구조 가이드를 제공한다.

제안 방법

  • 잔차 연결에서 새로운 정규화를 정의하고 적용한다: xl+1 = LN(α xl + Gl(xl, θl)).
  • 잔차 분기 내부의 서브레이어 가중치를 아키텍처 의존 계수 β로 스케일링한다.
  • ||ΔF||를 바운드하기 위한 초기화 스킴을 도출하여 SGD/Adam 하에서 업데이트가 O(η)로 남도록 보장한다.
  • N-레이어 DEEPNET 및 인코더-디코더 변형에 대한 이론적 업데이트 경계 제시(정리 4.2 및 4.3).
  • WMT En–De, IWSLT De–En 및 대규모 다국어 OPUS-100 및 Flores 데이터셋에서 실증적으로 검증한다.
  • 인코더-전용, 디코더-전용, 인코더-디코더 아키텍처에 대한 구체적 실용 초기화 값과 스케일링 규칙을 제공한다.

실험 결과

연구 질문

  • RQ11) 트랜스포머를 1,000층까지 확장했을 때 안정적으로 학습할 수 있는가?
  • RQ22) DEEPNORM이 Post-LN 및 Pre-LN 기준선과 비교해 성능을 보존하거나 향상시키면서 학습을 안정화하는가?
  • RQ33) 초기화 및 잔차 스케일링이 극도로 깊은 트랜스포머에서 모델 업데이트의 크기와 그래디언트 흐름에 어떤 영향을 미치는가?
  • RQ44) 깊이가 증가하더라도 DEEPNORM으로 얻는 이점이 양방향 및 다국어 설정에서 기계 번역 성능에 얼마나 실질적으로 기여하는가?

주요 결과

  • DEEPNET은 DEEPNORM으로 1,000층(2,500서브레이어)까지 안정적인 학습을 달성하며, 기존 방법은 수렴하지 못했다.
  • WMT-17 En–De에서 200층 DEEPNET은 28.9 BLEU를 달성하고, 48층의 12B 파라미터 기준선보다 깊이에서의 효율성을 보여준다.
  • 다국어 MT에서 DEEPNET은 200층(3.2B 파라미터)으로 OPUS-100 평균에서 4.4 BLEU를 48층 12B 기준선보다 상회한다(WMT/OPUS/TED/Flores).
  • DEEPNET은 1,000층으로 확장되며 3.8B 파라미터에서 다국어 평가에서 BLEU 33.9(WMT), 30.2(OPUS), 18.6(Flores)을 달성하며, M2M-100(12B, 48층)을 능가한다.
  • 이론적 분석은 DEEPNORM이 모델 업데이트를 상수로 바운드함을 보여주어, 깊은 트랜스포머에서 발생하는 업데이트 폭발 및 그래디언트 문제를 완화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.