Skip to main content
QUICK REVIEW

[논문 리뷰] LazyFormer: Self Attention with Lazy Update

Chengxuan Ying, Guolin Ke|arXiv (Cornell University)|2021. 02. 25.
Topic Modeling참고 문헌 24인용 수 9
한 줄 요약

LazyFormer는 여러 레이어로 구성된 블록당 한 번만 자기주의적 주의 분포를 계산하고 이를 후속 레이어에서 재사용함으로써 자기주의적 주의 계산을 줄이는 경량 트랜스포머 아키텍처를 제안한다. 표준 BERT와 동일한 성능을 유지하면서 추론 속도를 1.3배 빠르게 하며, 동일한 계산 예산 내에서 더 큰 모델과 더 나은 장문의 시퀀스 처리 효율성을 가능하게 한다.

ABSTRACT

Improving the efficiency of Transformer-based language pre-training is an important task in NLP, especially for the self-attention module, which is computationally expensive. In this paper, we propose a simple but effective solution, called \emph{LazyFormer}, which computes the self-attention distribution infrequently. LazyFormer composes of multiple lazy blocks, each of which contains multiple Transformer layers. In each lazy block, the self-attention distribution is only computed once in the first layer and then is reused in all upper layers. In this way, the cost of computation could be largely saved. We also provide several training tricks for LazyFormer. Extensive experiments demonstrate the effectiveness of the proposed method.

연구 동기 및 목표

  • 장문의 시퀀스에서 트랜스포머의 자기주의적 주의에 대한 제곱형 계산 비용을 줄이기 위해.
  • 연속된 레이어 간에 자기주의적 주의 분포가 안정적으로 유지되어 재사용 가능한지 탐색하기 위해.
  • 성능를 유지하면서 FLOPs를 크게 줄이는 효율적인 트랜스포머 변형을 설계하기 위해.
  • 동일한 사전학습 예산 내에서 더 큰 모델이나 더 긴 시퀀스를 훈련할 수 있도록 하기 위해.

제안 방법

  • LazyFormer은 트랜스포머 레이어를 '게으른 블록'으로 조직하며, 각 블록에는 m개의 스택된 레이어가 포함된다.
  • 각 게으른 블록 내에서 자기주의적 주의는 첫 번째 레이어에서만 계산되고, 블록의 모든 상위 레이어에서 재사용된다.
  • 이 방법으로 전체 자기주의적 주의 FLOPs는 O(kn²)에서 O(kn²/m)로 감소한다. 여기서 m은 블록당 레이어 수이다.
  • 공유된 주의 계산으로 인한 파라미터 수 감소에도 불구하고 모델 용량을 유지하기 위해 더 넓은 레이어(은닉/밀도 차원 증가)를 사용한다.
  • 성능에 해를 끼치지 않으면서도 효율성을 더 높이기 위해 자기주의적 주의 모듈에서 드롭아웃을 제거한다.
  • 표준 사전학습 목표를 사용하여, 너비와 깊이를 조정한 BERT 기반 설정을 수정한 방식으로 아키텍처를 훈련한다.

실험 결과

연구 질문

  • RQ1자기주의적 주의 분포를 성능 저하가 심각하지 않은 범위에서 여러 트랜스포머 레이어 간에 재사용할 수 있는가?
  • RQ2자기주의적 주의 계산을 덜 자주 수행하면 사전학습 및 추론에서 측정 가능한 효율성 향상이 이루어지는가?
  • RQ3LazyFormer은 동일한 계산 예산 내에서 더 큰 모델이나 더 긴 시퀀스를 훈련시킬 수 있는가?
  • RQ4자기주의적 주의에서 드롭아웃을 제거하면 게으른 주의 설정에서 효율성과 성능에 어떤 영향을 미치는가?

주요 결과

  • LazyFormer는 동일한 모델 용량을 유지하면서 표준 BERT보다 1.3배 빠른 추론 속도를 달성했고, 성능 저하 없이 성능을 유지했다.
  • 동일한 사전학습 비용을 사용할 경우, 더 큰 LazyFormer 모델(M2x6)이 GLUE 평균 점수에서 BERT보다 1.0점 높은 성능을 보였다.
  • 사전학습 비용의 50%만 사용해도 LazyFormer이 BERT보다 더 높은 GLUE 점수를 달성하여 강력한 효율성 향상을 입증했다.
  • 사전학습 과정에서 수렴 속도가 더 빨라서, M2x6-S는 BERT의 절반 수준의 학습 스텝으로 경쟁 가능한 성능에 도달했다.
  • 시퀀스 길이가 길어질수록 속도 향상 비율이 증가하여, O(n²) 계산이 지배적인 장문의 시퀀스에서 거의 2배의 속도 향상을 달성했다.
  • 자기주의적 주의에서 드롭아웃을 제거하면 약 10%의 효율성 향상이 이루어졌고, 약간의 성능 향상까지 기록하여 이 설정에서 드롭아웃의 비필수성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.