Skip to main content
QUICK REVIEW

[논문 리뷰] GLU Variants Improve Transformer

Noam Shazeer|arXiv (Cornell University)|2020. 02. 12.
Parallel Computing and Optimization Techniques참고 문헌 11인용 수 20
한 줄 요약

이 논문은 트랜스포머 피드포워드 네트워크에서 표준 ReLU 또는 GELU 활성화 함수를 대체하기 위해 새로운 게이팅 선형 유닛(Gated Linear Unit, GLU) 변형—ReGLU, GEGLU, SwiGLU, Bilinear—을 제안한다. 이러한 변형들은 사전 훈련 및 다운스트림 자연어 처리(NLP) 작업에서 모델 성능을 햖थ한다. 특히 GEGLU와 SwiGLU가 GLUE, SuperGLUE, SQuAD 벤치마크 전반에서 더 낮은 퍼플렉서티와 더 높은 정확도를 달성하여 최고의 성능을 보였다.

ABSTRACT

Gated Linear Units (arXiv:1612.08083) consist of the component-wise product of two linear projections, one of which is first passed through a sigmoid function. Variations on GLU are possible, using different nonlinear (or even linear) functions in place of sigmoid. We test these variants in the feed-forward sublayers of the Transformer (arXiv:1706.03762) sequence-to-sequence model, and find that some of them yield quality improvements over the typically-used ReLU or GELU activations.

연구 동기 및 목표

  • 표준 피드포워드 네트워크 활성화 함수를 새로운 GLU 기반 변형으로 대체하여 트랜스포머 모델의 성능을 향상시키는 것.
  • GLU 구성 요소 내에서 다른 비선형성(nonlinearities)이 순차적-순차적 모델의 표현 학습을 향상시킬 수 있는지 조사하는 것.
  • 이러한 GLU 변형이 사전 훈련 목표와 다운스트림 전이 학습 작업에 미치는 영향을 평가하는 것.
  • 아키텍처 수정을 통해 모델 품질을 향상시키면서도 계산 및 파라미터 효율성을 유지하는 것.
  • GLU 변형이 다양한 NLP 벤치마크에서 일관된 성능 향상을 이끌어내는 경험적 증거를 제공하는 것.

제안 방법

  • 첫 번째 선형 투영이 비선형 활성화 함수(예: 시그모이드, ReLU, GELU, Swish)에 의해 게이팅되는 가족형 GLU 변형을 제안하며, 출력은 두 번째 선형 투영과 요소별 곱셈(element-wise multiplication)을 수행한다.
  • 새로운 피드포워드 네트워크 구성 요소를 정의: FFN_GLU, FFN_Bilinear, FFN_ReGLU, FFN_GEGLU, FFN_SwiGLU로, 각각 GLU 메커니즘에서 다른 활성화 함수를 사용한다.
  • 원래의 두 가중치 피드포워드 네트워크와 동일한 파라미터 수와 계산량을 유지하기 위해, GLU 기반 모델에서 은닉 차원을 3072에서 2048로 감소시킨다.
  • Adafactor 최적화 및 역제곱근 학습률 스케줄링을 포함한 T5 모델 아키텍처와 훈련 설정을 사용하며, 사전 훈련 중 드롭아웃을 사용하지 않아 성능을 향상시킨다.
  • C4 스팸 채우기 사전 훈련 목표에서 모델을 평가하고, GLUE, SuperGLUE, SQuAD 작업의 혼합된 세트에서 미세조정(fine-tuning)을 수행한다.
  • 사전 훈련 중에 검증 세트를 활용해 로그-퍼플렉서티(log-perplexity)를 측정하고, 다운스트림 벤치마크에서 정확도 점수를 보고한다.

실험 결과

연구 질문

  • RQ1GELU나 Swish와 같은 다른 활성화 함수를 사용하는 GLU 변형이, 트랜스포머 피드포워드 네트워크에서 표준 ReLU나 GELU보다 성능을 향상시키는가?
  • RQ2기존의 두 가중치 피드포워드 네트워크를 세 가중치를 가진 GLU 기반 아키텍처로 대체하면, 계산 비용을 증가시키지 않으면서도 더 좋은 성능을 낼 수 있는가?
  • RQ3ReGLU, GEGLU, SwiGLU, Bilinear과 같은 다양한 GLU 변형은 사전 훈련 손실과 다운스트림 전이 학습 성능 측면에서 어떻게 비교되는가?
  • RQ4GLU 변형의 사용이 GLUE, SuperGLUE, SQuAD와 같은 다양한 NLP 벤치마크에서 일관된 성능 향상을 이끌어내는가?
  • RQ5이론적 설명이 제공되지 않았음에도 불구하고, 왜 일부 GLU 변형(예: GEGLU, SwiGLU)이 특별히 뛰어난 성능을 내는가?

주요 결과

  • GEGLU와 SwiGLU 변형은 524,288개의 훈련 스텝에서 각각 1.633과 1.636의 가장 낮은 검증 세트 로그-퍼플렉서티를 기록하여 ReLU 기준선(1.677)을 능가했다.
  • GLUE 벤치마크에서 GEGLU는 평균 점수 86.17을 기록하여 ReLU 기준선(85.83)과 원본 T5 모델(84.24)을 초월했다.
  • SuperGLUE 벤치마크에서 SwiGLU는 평균 점수 86.54를 기록하여 원본 T5 모델의 78.56과 ReLU 기준선의 77.88를 뛰어넘었다.
  • SQuAD v1.1에서 ReGLU는 EM 점수 83.53과 F1 점수 91.18을 기록하여 ReLU 기준선(83.18 EM, 90.87 F1)을 능가했다.
  • Bilinear 변형은 두 번째로 낮은 퍼플렉서티(1.648)를 기록했고 SuperGLUE에서 평균 83.65의 뛰어난 성능을 보여, 비선형성이 없음에도 불구하고 효과적임을 입증했다.
  • 모든 GLU 변형이 여러 벤치마크에서 일관된 성능 향상을 보였으며, 이는 아키텍처적 변경이 일반화 및 표현 학습 능력을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.