Skip to main content
QUICK REVIEW

[논문 리뷰] Reformer: The Efficient Transformer

Nikita Kitaev, Łukasz Kaiser|arXiv (Cornell University)|2020. 01. 13.
Advanced Image and Video Retrieval Techniques참고 문헌 18인용 수 323
한 줄 요약

Reformer는 가역적 계층, 청크된 피드포워드, 그리고 지역민감 해시 어텐션을 도입하여 메모리와 계산을 줄이고, 긴 시퀀스에서 Transformer와 유사한 성능을 훨씬 더 우수한 효율로 달성한다.

ABSTRACT

Large Transformer models routinely achieve state-of-the-art results on a number of tasks but training these models can be prohibitively costly, especially on long sequences. We introduce two techniques to improve the efficiency of Transformers. For one, we replace dot-product attention by one that uses locality-sensitive hashing, changing its complexity from O($L^2$) to O($L\log L$), where $L$ is the length of the sequence. Furthermore, we use reversible residual layers instead of the standard residuals, which allows storing activations only once in the training process instead of $N$ times, where $N$ is the number of layers. The resulting model, the Reformer, performs on par with Transformer models while being much more memory-efficient and much faster on long sequences.

연구 동기 및 목표

  • 대형 Transformer 모델이 긴 시퀀스에서 가지는 높은 메모리 및 계산 비용을 동기부여한다.
  • 성과를 유지하면서 메모리와 계산을 줄이기 위한 아키텍처와 기법을 제안한다.
  • 긴 시퀀스 작업과 표준 벤치마크에서 실험적으로 검증하여 효율성 향상을 보인다.
  • 공유-QK 어텐션, 가역적 계층, LSH 어텐션이 학습 역학 및 정확도에 미치는 영향을 평가한다.

제안 방법

  • 점(dot-product) 어텐션을 지역민감 해시(LSH) 어텐션으로 대체하여 주의 계산 복잡도를 O(L^2)에서 O(L log L)로 줄인다.
  • 가역 잔차 계층을 사용하여 모든 레이어의 활성값 저장을 피하고 네트워크 깊이에 따른 N배 메모리 증가를 제거한다.
  • 활성화를 더 작은 블록으로 처리하여 메모리 사용량을 줄이기 위해 피드포워드 레이어를 청크로 분리한다.
  • 공유-QK 어텐션을 채택하여 투사 경로를 단순화하고 성능에 미치는 영향을 분석한다.
  • 다중 라운드 해싱을 사용하여 LSH 어텐션의 정확도를 향상시키고 버킷 충돌을 완화한다.
  • 이론적 메모리/시간 복잡도 비교 및 다양한 태스크에 대한 경험적 제거 실험을 제공한다.

실험 결과

연구 질문

  • RQ1가역적 계층이 메모리 사용량을 줄이면서 Transformer 성능을 보존할 수 있는가?
  • RQ2LSH 기반 어텐션이 긴 시퀀스에 대해 전체 어텐션을 충분히 근사하는가, 그리고 해싱 매개변수가 정확도에 어떤 영향을 미치는가?
  • RQ3공유-QK 어텐션과 청크된 피드포워드가 학습 역학과 효율성에 어떤 영향을 미치는가?
  • RQ4표준 Transformer에 비해 매우 긴 시퀀스에서 Reformer의 실용적인 메모리 및 속도 이점은 무엇인가?

주요 결과

  • 가역적 Transformer는 표준 Transformer 성능과 유사하거나 더 낮은 메모리 사용으로 더 깊은 모델 구성을 가능하게 한다.
  • 공유-QK 어텐션은 성능에 악영향을 주지 않으며 enwik8에서 학습 속도를 높일 수 있다.
  • LSH 어텐션은 해싱 라운드가 증가할수록 전체 어텐션에 더 근접하도록 정확도가 증가한다(예: 더 많은 라운드가 전체 어텐션과 근접한 결과를 낳는다).
  • 청크화된 피드포워드 레이어는 메모리를 줄이면서도 파라미터가 같은 경우 수치적 등가성을 유지한다.
  • Reformer는 긴 시퀀스에서 더 크고 메모리 효율적인 모델 구성을 가능하게 하며 enwik8 및 imagenet-64와 같은 장-context 작업에서 더 빠른 학습 및 메모리 절감을 보여준다.
  • WMT14 영어-독일어 번역에서 가역적 Transformer는 다양한 구성에서 경쟁력 있는 BLEU 점수를 달성한다. 예: 기본 가역 모델 27.6 BLEU(sacreBLEU 27.4) 및 대형 가역 모델 29.1 BLEU(sacreBLEU 28.4).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.