Skip to main content
QUICK REVIEW

[논문 리뷰] Primer: Searching for Efficient Transformers for Language Modeling

David R. So, Wojciech Mańke|arXiv (Cornell University)|2021. 09. 17.
Topic Modeling참고 문헌 56인용 수 11
한 줄 요약

이 논문은 자동적 순서화 언어 모델링을 위한 더 효율적인 Transformer 아키텍처인 Primer를 소개한다. 이는 텐서플로 계산 그래프에 직접적으로 탐색을 수행함으로써 달성된다. Q/K/V 프로젝션 이후에 ReLU 활성화를 제곱하고, 깊이 분리형 컨볼루션을 추가함으로써, T5 대비 최대 4.2배, GPT-3 XL 수준의 모델 대비 3배의 훈련 계산량을 줄일 수 있으며, 다양한 설정에서 성능을 유사하거나 초월하면서도 더 적은 계산 자원을 사용한다.

ABSTRACT

Large Transformer models have been central to recent advances in natural language processing. The training and inference costs of these models, however, have grown rapidly and become prohibitively expensive. Here we aim to reduce the costs of Transformers by searching for a more efficient variant. Compared to previous approaches, our search is performed at a lower level, over the primitives that define a Transformer TensorFlow program. We identify an architecture, named Primer, that has a smaller training cost than the original Transformer and other variants for auto-regressive language modeling. Primer's improvements can be mostly attributed to two simple modifications: squaring ReLU activations and adding a depthwise convolution layer after each Q, K, and V projection in self-attention. Experiments show Primer's gains over Transformer increase as compute scale grows and follow a power law with respect to quality at optimal model sizes. We also verify empirically that Primer can be dropped into different codebases to significantly speed up training without additional tuning. For example, at a 500M parameter size, Primer improves the original T5 architecture on C4 auto-regressive language modeling, reducing the training cost by 4X. Furthermore, the reduced training cost means Primer needs much less compute to reach a target one-shot performance. For instance, in a 1.9B parameter configuration similar to GPT-3 XL, Primer uses 1/3 of the training compute to achieve the same one-shot performance as Transformer. We open source our models and several comparisons in T5 to help with reproducibility.

연구 동기 및 목표

  • 대규모 Transformer 언어 모델의 높은 훈련 및 추론 비용을 줄이기 위해.
  • 텐서플로 계산 그래프에 대한 저수준 탐색을 통해 더 효율적인 Transformer 변종을 발견하기 위해.
  • 초기 설정 조정이 필요 없는 단순하고 실용적인 수정 사항을 개발하기 위해.
  • 특히 스케일이 클수록 성능을 훼손하지 않으면서도 상당한 계산 자원 절감을 달성하기 위해.
  • 기존 표준 Transformer를 최소한의 코드 변경으로 즉시 대체할 수 있도록 하기 위해.

제안 방법

  • 자동적 순서화 언어 모델의 디코더 블록을 정의하는 텐서플로 프로그램을 대상으로 탐색을 수행한다.
  • 활성화 함수, 정규화, 어텐션 구성 요소와 같은 저수준 연산을 포함한 탐색 공간을 설정한다.
  • 고정된 계산 예산 하에서 검증 손실을 최소화하기 위해 진화 알고리즘을 사용하여 공간을 탐색한다.
  • T5 및 T2T와 같은 기존 라이브러리에서 제공하는 고정된 하이퍼파라미터 세트를 사용하여 각 모델을 평가한다.
  • 블록 기반 탐색 공간과 달리 구성 요소의 재정렬 및 원소의 수정(예: 활성화 또는 정규화 순서 변경)이 가능한 탐색 공간을 제공한다.
  • 두 가지 핵심 수정 사항이 도출되었다: ReLU 활성화를 제곱하고, Q, K, V 프로젝션 이후에 깊이 분리형 컨볼루션 레이어를 삽입한다.

실험 결과

연구 질문

  • RQ1Transformer 계산 그래프에 대한 저수준 아키텍처 수정이 성능 손실 없이 상당한 훈련 비용 절감을 이끌 수 있는가?
  • RQ2제안된 수정 사항(제곱된 ReLU 및 깊이 분리형 컨볼루션)이 다양한 모델 크기와 계산 규모에서 효율성과 품질에 어떻게 기여하는가?
  • RQ3발견된 아키텍처는 재조정 없이 기존 코드베이스에 즉시 대체로 배치될 수 있는가?
  • RQ4Primer의 효율성 향상은 계산량 증가와 함께 비례하는가? 또한 모델 품질에 대해 거듭 제곱 법칙을 따르는가?
  • RQ5성능 향상은 다양한 데이터셋, 하드웨어 플랫폼, 모델 패밀리에 일반화 가능한가?

주요 결과

  • Primer는 C4 데이터셋에서 5억 파라미터 모델에 대해 원본 T5 모델과 동일한 성능을 달성하기 위해 훈련 계산량을 4.2배 줄였다.
  • GPT-3 XL 수준의 약 19억 파라미터 모델에 대해, Primer는 훈련 계산량의 1/3만으로 동일한 one-shot 성능을 달성했다.
  • 모델 크기(2000만에서 19억 파라미터), 데이터셋(LM1B, C4, PG19), 하드웨어(TPUv2에서 V100), 코드베이스(T5, Lingvo, T2T) 전반에 걸쳐 성능 향상이 안정적으로 유지된다.
  • 두 핵심 수정 사항—Q/K/V 프로젝션 이후에 깊이 분리형 컨볼루션을 삽입하고 ReLU 활성화를 제곱하는 것—이 대부분의 성능 향상에 기여한다.
  • Primer의 계산 자원 절감은 스케일이 증가함에 따라 증가하며, 최적 크기의 모델을 사용할 경우 모델 품질에 대해 거듭 제곱 법칙을 따르는 경향이 있다.
  • Primer-EZ(간소화된 버전)는 T5에서 잘 작동하지만, Lingvo 및 T2T와 같은 다른 코드베이스에서는 전체 Primer가 더 뛰어난 성능을 보이며, 더 넓은 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.