Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?

Yi Tay, Mostafa Dehghani|arXiv (Cornell University)|2022. 07. 21.
Neural Networks and Applications인용 수 11
한 줄 요약

이 논문은 다양한 모델 아키텍처와 그들의 인덕티브 바이어스가 언어 모델의 스케일링 법칙에 어떻게 영향을 미치는지 조사한다. 10가지의 다양한 아키텍처를 포함해 총 100개의 모델을 대상으로 광범위한 사전 훈련 및 미세조정을 수행한다. 그 결과, 바닐라 트랜스포머가 가장 강력한 스케일링 행동을 보이며, MLP-Mixer, Performer, ALBERT와 같은 아키텍처는 크기가 커질수록 스케일링이 잘 되지 않거나 심지어 성능이 악화되는 것으로 나타나, 업스트림에서 다운스트림 성능으로의 이행 가능성에 대한 기존 가정을 도전한다.

ABSTRACT

There have been a lot of interest in the scaling properties of Transformer models. However, not much has been done on the front of investigating the effect of scaling properties of different inductive biases and model architectures. Do model architectures scale differently? If so, how does inductive bias affect scaling behaviour? How does this influence upstream (pretraining) and downstream (transfer)? This paper conducts a systematic study of scaling behaviour of ten diverse model architectures such as Transformers, Switch Transformers, Universal Transformers, Dynamic convolutions, Performers, and recently proposed MLP-Mixers. Via extensive experiments, we show that (1) architecture is an indeed an important consideration when performing scaling and (2) the best performing model can fluctuate at different scales. We believe that the findings outlined in this work has significant implications to how model architectures are currently evaluated in the community.

연구 동기 및 목표

  • 다양한 모델 아키텍처에서 유도되는 인덕티브 바이어스가 언어 모델의 스케일링 행동에 어떻게 영향을 미치는지 이해하는 것.
  • 단일 컴퓨팅 규모에서의 성능이 다양한 모델 크기와 컴퓨팅 영역에서의 스케일링 능력을 신뢰성 있게 예측할 수 있는지 평가하는 것.
  • 업스트림 사전 훈련 성능(퍼플렉서티)과 다운스트림 전이 성능 사이의 괴리 현상을 조사하는 것.
  • 다양한 스케일링 프로토콜(깊이 대 대칭)이 다양한 아키텍처에 미치는 영향을 평가하는 것.
  • 다양한 컴퓨팅 제약 조건에서 효과적으로 스케일링되는 모델 설계를 위한 경험적 통찰을 제공하는 것.

제안 방법

  • 저자는 15M에서 40B 파라미터에 이르는 다양한 아키텍처 10종에 대해 총 100개의 모델을 사전 훈련 및 미세조정한다.
  • 모델 크기에 따른 업스트림(음의 로그 퍼플렉서티) 및 다운스트림(정확도) 성능에 대해 거듭제곱 법칙 모델을 피팅하여 스케일링 법칙을 유도한다.
  • 업스트림 및 다운스트림 성능의 스케일링 계수(α)를 분석하고, 다운스트림 스케일링이 업스트림에 비해 어느 정도인지 측정하기 위해 α_U,D 를 도입한다.
  • 네 가지 대표적인 아키텍처(MoS-Transformer, Transformer, Evolved Transformer, LConv)에 대해 깊이와 너비를 변화시키는 다양한 스케일링 프로토콜을 적용하여 아키텍처 민감도를 평가한다.
  • 점별 평가를 넘어서 스케일링 경향을 포괄하기 위해 여러 컴퓨팅 영역에서 실험을 수행한다.
  • 표준 트랜스포머 외에도 MLP-Mixer, Performer, 동적 컨볼루션과 같은 비-트랜스포머 아키텍처도 분석에 포함한다.

실험 결과

연구 질문

  • RQ1다양한 모델 아키텍처가 업스트림 퍼플렉서티와 다운스트림 정확도 측면에서 어떻게 스케일링되나?
  • RQ2단일 컴퓨팅 규모에서의 강력한 성능이 다양한 모델 크기에서의 스케일링 능력을 신뢰성 있게 예측할 수 있는가?
  • RQ3업스트림 사전 훈련 성능이 아키텍처 간에 다운스트림 전이 성능과 어느 정도 상관관계가 있는가?
  • RQ4다양한 스케일링 프로토콜(깊이 대 너비)이 다양한 아키텍처의 스케일링 행동에 어떻게 영향을 미치는가?
  • RQ5어떤 인덕티브 바이어스가 강력한 스케일링을 이끌고, 어떤 것은 부정적 또는 평탄한 스케일링 경향을 유도하는가?

주요 결과

  • 바닐라 트랜스포머는 모든 아키텍처 중에서 가장 강력한 스케일링 행동을 보이며, 모든 아키텍처에서 가장 높은 스케일링 계수 α 를 기록한다.
  • 낮은 규모에서 강력한 절대 성능를 보이지만, MLP-Mixer, Performer, ALBERT와 같은 모델은 특히 다운스트림 작업에서 부정적 또는 평탄한 스케일링 경향을 보인다.
  • ALBERT는 업스트림 퍼플렉서티에서 부정적 스케일링을 보이며, 인코더와 디코더 레이어 간에 파라미터를 공유하기 때문일 가능성이 높다.
  • 스위치 트랜스포머는 업스트림 성능 대비 가장 뛰어난 다운스트림 스케일링 성능(가장 높은 α_U,D)을 기록하여 강력한 전이 가능성(transferability)을 보여준다.
  • 표준 트랜스포머에 최소한의 수정을 가한 아키텍처(예: GLU-Transformer, MoS-Transformer)는 바닐라 트랜스포머와 유사한 스케일링 행동을 유지한다.
  • 깊이 스케일링은 너비 스케일링보다 다운스트림 성능에 더 큰 영향을 미치며, LConv는 프로토콜 간에 일관되지 않은 스케일링을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.