[논문 리뷰] RealFormer: Transformer Likes Residual Attention
RealFormer은 주어진 파라미터 없이도 주어진 Transformer 모델의 성능을 햖थ히 향상시키기 위해 주어진 attention 점수에 잔차 연결을 추가하는 단순한 기법을 제안한다. 이는 GLUE, SQuAD, 기계 번역 등 다양한 NLP 작업에서 뛰어난 성능 향상을 이끌어내며, 더 빠른 수렴과 더 희소하고 안정적인 attention 패턴을 제공한다.
Transformer is the backbone of modern NLP models. In this paper, we propose RealFormer, a simple and generic technique to create Residual Attention Layer Transformer networks that significantly outperform the canonical Transformer and its variants (BERT, ETC, etc.) on a wide spectrum of tasks including Masked Language Modeling, GLUE, SQuAD, Neural Machine Translation, WikiHop, HotpotQA, Natural Questions, and OpenKP. We also observe empirically that RealFormer stabilizes training and leads to models with sparser attention. Source code and pre-trained checkpoints for RealFormer can be found at https://github.com/google-research/google-research/tree/master/realformer.
연구 동기 및 목표
- 파라미터나 하이퍼파라미터를 추가하지 않고도 다양한 NLP 작업에서 Transformer 기반 모델의 성능을 향상시키는 것.
- ResNet의 잔차 연결과 유사하게 attention 점수에 직접 경로를 만드는 것이 학습 안정성과 일반화 성능 향상에 기여하는지 조사하는 것.
- BERT, ADMIN, ETC와 같은 기존 모델에 잔차 attention을 즉각 적용할 수 있는지 평가하는 것.
- RealFormer에서 attention 메커니즘의 정성적 행동, 특히 레이어 간 희소성과 상관관계를 분석하는 것.
제안 방법
- 이전 레이어의 원본 attention 점수를 직접 현재 레이어로 전달하는 스킵 연결을 추가하여 잔차 attention 메커니즘을 도입한다.
- 표준 Transformer 인코더 블록을 수정하여, 원본 multi-head attention 점수와 이전 레이어의 잔차 스트림인 attention 점수를 결합한 후 softmax를 적용한다.
- 잔차 성분으로서 attention 점수의 누적 합을 사용하여 원본 attention 계산을 유지하면서도 잔차 경로를 통해 기울기 흐름을 가능하게 한다.
- ETC와 같은 희소 attention 메커니즘을 포함한 다양한 Transformer 변종에 대해 이 기법을 일반적으로 적용한다.
- 기준 모델과 동일한 사전 훈련 및 미세조정 레시피를 사용하여 공정한 비교를 확보하며, 최소한의 코드 변경이 필요하다.
- 특히 대규모 모델에서의 강건성 향상을 위해 추론 시 체크포인트 평균화를 적용한다.
실험 결과
연구 질문
- RQ1기존 및 최신 Transformer 모델의 다양한 NLP 작업에서 attention 점수에 잔차 연결을 추가하면 성능 향상이 이루어지는가?
- RQ2잔차 attention은 Post-LN 및 Pre-LN Transformer에 비해 더 안정적인 학습 역학과 향상된 수렴 속도를 제공하는가?
- RQ3잔차 attention은 훈련된 모델에서 attention의 희소성과 레이어 간 상관관계에 어떤 영향을 미치는가?
- RQ4RealFormer은 아키텍처나 하이퍼파라미터 변경 없이도 기존 Transformer 아키텍처에 일반적인 플러그 앤 플레이 개선 기법으로 활용될 수 있는가?
- RQ5잔차 attention은 표준 기준 모델에 비해 더 적은 사전 훈련 에포크 수로도 더 뛰어난 성능을 낼 수 있는가?
주요 결과
- RealFormer은 마스크된 언어 모델링 및 하류 GLUE 작업 전반에서 Post-LN 및 Pre-LN Transformer를 모두 압도하며, 평균적으로 최대 2.5점의 향상이 이루어졌다.
- WMT’14 En-Fr 번역 벤치마크에서 RealFormer은 단지 50개의 사전 훈련 에포크만으로 기존 SOTA인 ADMIN 모델보다 0.25 BLEU 점수 높은 새로운 SOTA BLEU 점수 43.97을 기록했다.
- WikiHop 벤치마크에서 RealFormer은 정확도를 84.4%로 향상시켜 이전 SOTA보다 2.1%p의 절대적 향상률을 기록했으며 공식 랭킹에서 1위를 차지했다.
- RealFormer은 ETC-Large가 모든 네 가지 장거리 컨텍스트 벤치마크에서 성능 향상을 보였다: HotpotQA (공동 F1: 73.57 vs. 73.12), Natural Questions (평균 F1: 68.51 vs. 68.07), OpenKP (F1@3: 44.27 vs. 44.06).
- 정성적 분석 결과, RealFormer은 헤드 내부와 인접한 레이어 간에 더 희소한 attention 패턴을 생성하는 것으로 나타났으며, 이는 학습 안정화에 기여할 수 있는 정규화 효과를 암시한다.
- 기준 모델보다 사전 훈련 에포크 수를 반으로 줄였음에도 불구하고 RealFormer은 경쟁적인 미세조정 성능을 달성하여 더 빠른 수렴과 더 뛰어난 샘플 효율성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.