Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Skip Connection with Layer Normalization in Transformers and ResNets

Fenglin Liu, Xuancheng Ren|arXiv (Cornell University)|2021. 05. 15.
Advanced Neural Network Applications참고 문헌 25인용 수 13
한 줄 요약

이 논문은 깊은 신경망에서 훈련 안정성과 최적화를 향상시키기 위해 반복적으로 계층 정규화를 적용하는 확대된 스킵 커넥션을 활용하는 새로운 잔차 블록 설계인 Recursive Skip Connection with Layer Normalization (2rSkip+LN)을 제안한다. 이 방법은 ResNet과 Transformer 모두에서 일관된 성능 향상을 이끌어내며, CIFAR-100에서 최대 1.02의 절대 오차 감소와 기계 번역에서 1 BLEU 이상의 향상(1.2 BLEU 점수 향상, EN-VI), 0.7(EN-DE), 0.8(EN-FR))을 기록하여 표준 스킵 커넥션보다 뛰어난 일반화 능력과 강건성을 입증한다.

ABSTRACT

Skip connection, is a widely-used technique to improve the performance and the convergence of deep neural networks, which is believed to relieve the difficulty in optimization due to non-linearity by propagating a linear component through the neural network layers. However, from another point of view, it can also be seen as a modulating mechanism between the input and the output, with the input scaled by a pre-defined value one. In this work, we investigate how the scale factors in the effectiveness of the skip connection and reveal that a trivial adjustment of the scale will lead to spurious gradient exploding or vanishing in line with the deepness of the models, which could be addressed by normalization, in particular, layer normalization, which induces consistent improvements over the plain skip connection. Inspired by the findings, we further propose to adaptively adjust the scale of the input by recursively applying skip connection with layer normalization, which promotes the performance substantially and generalizes well across diverse tasks including both machine translation and image classification datasets.

연구 동기 및 목표

  • 스킵 커넥션의 스케일 인자 영향이 깊은 신경망의 기울기 안정성과 최적화에 미치는 영향을 조사하는 것.
  • 스킵 커넥션에서 신뢰성 없는 스케일링으로 인한 기울기 폭발/소실 문제를 계층 정규화가 어떻게 완화할 수 있는지 탐구하는 것.
  • 적응형 스케일링과 계층 정규화를 결합한 새로운 스킵 커넥션 메커니즘을 설계하여 훈련 안정성과 성능을 향상시키는 것.
  • 이를 다양한 작업(이미지 분류, 기계 번역 포함)에 적용하여 일반화 능력과 확장성 평가를 수행하는 것.
  • 계층 정규화를 갖는 잔차 블록에서 고정 또는 학습 가능한 스케일 인자 중 어느 것이 최적의 성능을 낳는지 규명하는 것.

제안 방법

  • 스킵 입력을 λ > 1로 스케일링하고 계층 정규화를 통해 정규화하여 기울기 안정성을 높이는 확장된 스킵 커넥션을 제안한다.
  • 스케일된 스킵 커넥션에 대해 반복적으로 계층 정규화를 적용하는 Recursive Skip Connection with Layer Normalization (2rSkip+LN)을 도입하여 깊은 블록을 거쳐도 안정적인 기울기 흐름을 가능하게 한다.
  • 아키텍처는 y = LN(λ·x + F(x, W))로 수식화되며, 스킵 항목이 반복적으로 계층 정규화를 거쳐 기울기 안정성을 유지한다.
  • CNN과 Transformer 모두에서 변수 길이의 시퀀스를 더 잘 다루고 일반화 능력을 향상시키기 위해 배치 정규화 대신 계층 정규화를 사용한다.
  • CIFAR-100과 WMT 번역 데이터셋에서 ResNet과 Transformer 아키텍처를 대상으로 추론 및 비교를 통한 방법 검증을 수행한다.
  • 반복 변형에서는 고정된 λ = 2를 사용하며, 추론 분석을 통해 정규화와 함께 높은 스케일링이 성능 향상에 기여함을 확인한다.

실험 결과

연구 질문

  • RQ1λ ≠ 1로 스킵 커넥션을 스케일링하면 깊은 신경망에서 기울기 불안정성이 발생하는가? 계층 정규화는 이를 완화할 수 있는가?
  • RQ2계층 정규화와 스케일된 스킵 커넥션의 조합이 잔차 네트워크의 최적화 및 수렴에 어떤 영향을 미치는가?
  • RQ3스케일된 스킵 커넥션에 대해 계층 정규화를 반복 적용하면 훈련 안정성과 모델 성능이 향상되는가?
  • RQ4제안된 2rSkip+LN 아키텍처는 ResNet과 Transformer와 같은 다양한 아키텍처 및 이미지 분류, 기계 번역과 같은 다양한 작업에 일반화 가능한가?
  • RQ5계층 정규화와 결합할 때 스킵 커넥션의 최적 스케일 인자 λ는 무엇이며, 이는 모델 깊이 또는 데이터셋 복잡성에 따라 달라지는가?

주요 결과

  • 제안된 2rSkip+LN 방법은 ResNet-110를 사용해 CIFAR-100에서 1.02의 절대 오차 감소를 달성하여 깊은 모델에서 뚜렷한 성능 향상을 보였다.
  • 기계 번역에서는 Transformer-Base가 EN-VI에서 1.2 BLEU, EN-DE에서 0.7 BLEU, EN-FR에서 0.8 BLEU 향상되어 더 많은 파라미터를 가진 더 큰 모델보다 뛰어난 성능을 보였다.
  • 모든 모델 깊이에서 CIFAR-100에서 일관되게 성능 향상을 보였으며, 더 깊은 네트워크에서 더 큰 향상을 기록하여 깊은 표현의 최적화가 향상됨을 시사했다.
  • 이미지 분류(ResNet)와 시퀀스 모델링(Transformer) 모두에서 성능 향상이 일관되게 나타나, 아키텍처 및 작업 간 일반화 능력이 뛰어남을 확인했다.
  • 특히 더 깊은 모델에서 계층 정규화가 배치 정규화보다 기울기 안정성 확보에 더 효과적임을 확인했다.
  • 추론 연구를 통해 스킵 커넥션만 스케일링하면 최적화 문제가 발생하고, 계층 정규화만 적용해도 충분하지 않음을 확인했으며, 오직 이 둘의 반복적 조합이 안정적이고 효과적인 훈련을 보장함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.