Skip to main content
QUICK REVIEW

[논문 리뷰] Foundation Transformers

Hongyu Wang, Shuming Ma|arXiv (Cornell University)|2022. 10. 12.
Natural Language Processing Techniques인용 수 13
한 줄 요약

이 논문은 언어, 시각, 음성 및 다중모态 작업 전반에서 아키텍처와 훈련 안정성을 통합하는 Foundation Transformer 변종인 Magneto를 소개한다. Sub-LayerNorm과 이론적으로 근거를 둔 초기화 전략을 제안함으로써, BERT, GPT, ViT, BEiT-3와 같은 실제 표준 Transformer 변종보다 뛰어난 성능과 향상된 훈련 안정성을 달성한다.

ABSTRACT

A big convergence of model architectures across language, vision, speech, and multimodal is emerging. However, under the same name "Transformers", the above areas use different implementations for better performance, e.g., Post-LayerNorm for BERT, and Pre-LayerNorm for GPT and vision Transformers. We call for the development of Foundation Transformer for true general-purpose modeling, which serves as a go-to architecture for various tasks and modalities with guaranteed training stability. In this work, we introduce a Transformer variant, named Magneto, to fulfill the goal. Specifically, we propose Sub-LayerNorm for good expressivity, and the initialization strategy theoretically derived from DeepNet for stable scaling up. Extensive experiments demonstrate its superior performance and better stability than the de facto Transformer variants designed for various applications, including language modeling (i.e., BERT, and GPT), machine translation, vision pretraining (i.e., BEiT), speech recognition, and multimodal pretraining (i.e., BEiT-3).

연구 동기 및 목표

  • 다양한 모odal과 작업 간에 통합적이고 일반적인 Transformer 아키텍처가 부족한 문제를 해결한다.
  • 특히 확장 시에 발생하는 훈련 불안정성 문제를 극복한다.
  • 언어, 시각, 음성 및 다중모달 응용 분야에서 작업별 맞춤 조정 없이도 우수한 성능을 내는 단일 백본 아키텍처를 개발한다.
  • 이론적으로 유도된 초기화와 아키텍처 혁신을 통해 훈련 안정성을 확보한다.
  • 다양한 최종 사용자 작업에서 더 높은 학습률과 더 강력한 최적화를 가능하게 한다.

제안 방법

  • 각 서브레이어(자기주의 어텐션 및 피드포워드 네트워크)의 입력 및 출력 투영 전에 추가적인 LayerNorm을 적용하는 Sub-LayerNorm(Sub-LN)을 제안한다.
  • Wang 등(2022a)의 DeepNet에서 영감을 얻은 새로운 초기화 전략을 도입하며, 모델의 깊이와 아키텍처 유형에 따라 조절 가능한 이득 값을 적용한다.
  • Transformer 블록 내 모든 선형 투영에 초기화를 적용하며, 쿼리/키 투영과 피드포워드 및 출력 투영에 대해 서로 다른 이득 요소를 사용한다.
  • 언어, 시각, 음성 및 다중모달 전반에서 아키텍처 재조정 없이 동일한 아키텍처와 초기화를 적용한다.
  • Sub-LN과 초기화에서 유도된 안정성 덕분에 더 높은 학습률을 허용하며, 표준 최적화 절차를 통해 종단 간 훈련을 수행한다.
  • 마스크된 언어 모델링(BERT), 인과 언어 모델링(GPT), 기계 번역, 마스크된 이미지 모델링(BEiT), 음성 인식(T-T), 시각-언어 사전학습(BEiT-3) 등 다양한 작업에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1특수화된 아키텍처 없이도 단일 Transformer 아키텍처가 언어, 시각, 음성 및 다중모달 작업 전반에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2Post-LN 및 Pre-LN 변종과 비교해 Sub-LayerNorm이 표현력 향상과 최적화 안정성 향상에 기여하는가?
  • RQ3이론적으로 근거를 둔 초기화 전략이 특히 더 깊은 모델에서의 확장 과정 중 안정적인 훈련을 보장할 수 있는가?
  • RQ4제안된 Foundation Transformer가 발산 없이 더 높은 학습률을 허용함으로써 훈련 효율성을 향상시키는가?
  • RQ5다중모달 사전학습, 특히 시각-언어 작업에서 통합 아키텍처가 모달별 특화 변종을 능가할 수 있는가?

주요 결과

  • 12층 및 24층 모델에서 ImageNet 검증 세트에서 Pre-LN 기준보다 각각 0.4% 및 0.6% 향상된 성능을 기록했으며, ViT를 모두 초월한다.
  • ADE20k 세그멘테이션 작업에서 Magneto는 12층 모델로 52.2% mIoU, 24층 모델로 54.6% mIoU를 달성하여, 기존 ViT보다 각각 0.8% 및 1.0% 높은 성능을 보였다.
  • LibriSpeech 960시간 음성 인식 작업에서, 18L 및 36L 설정 모두에서 Pre-LN 기준보다 WER가 6% 이상 감소했다.
  • 시각-언어 작업에서, Magneto는 테스트-표준 분할에서 VQA 정확도를 0.5% 향상시키고, 테스트 세트에서 NLVR2 정확도를 0.8% 향상시켰다.
  • 36층 모델에서 Magneto는 최대 학습률 3e-3를 허용하는 반면, Pre-LN 기준은 1.5e-3로 제한되어 있어, 더 뛰어난 최적화 안정성을 입증했다.
  • 모든 평가된 모달에서 일관된 성능 향상을 유지함으로써, Magneto가 진정한 일반 목적의 기초 아키텍처로서의 역할을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.