[논문 리뷰] Parameter Norm Growth During Training of Transformers.
이 논문은 경사 하강법(GD)이 트랜스포머 파라미터의 L2 노름이 훈련 도중 어떻게 증가하는지 조사하며, 더 높은 훈련 정확도가 더 큰 노름 증가를 가능하게 한다고 보여준다. 이는 노름 증가가 네트워크 포화를 유도하고 모델 용량을 감소시켜, 특히 T5와 같은 NLP 모델에 특히 관련이 깊은 이전에 인식되지 않았던 GD의 인도적 편향을 드러낸다.
The capacity of neural networks like the widely adopted transformer is known to be very high. Evidence is emerging that they learn successfully due to inductive bias in the training routine, typically some variant of gradient descent (GD). To better understand this bias, we study the tendency of transformer parameters to grow in magnitude during training. We find, both theoretically and empirically, that, in certain contexts, GD increases the parameter $L_2$ norm up to a threshold that itself increases with training-set accuracy. This means increasing training accuracy over time enables the norm to increase. Empirically, we show that the norm grows continuously over pretraining for T5 (Raffel et al., 2019). We show that pretrained T5 approximates a semi-discretized network with activation functions. Such saturated networks are known to have a reduced capacity compared to the original network family that can be described in automata-theoretic terms. This suggests saturation is a new characterization of an inductive bias implicit in GD that is of particular interest for NLP. While our experiments focus on transformers, our theoretical analysis extends to other architectures with similar formal properties, such as feedforward ReLU networks.
연구 동기 및 목표
- 경사 하강법이 트랜스포머 훈련에서 파라미터 노름 역학을 통해 유도하는 인도적 편향을 이해하기.
- 높은 용량에도 불구하고 트랜스포머가 잘 일반화되는 이유를 분석하며, 훈련 역학이 모델 행동을 어떻게 형성하는지 조사하기.
- 증가하는 훈련 정확도와 자기주의 주의 및 피드포워드 계층에서의 파라미터 노름 증가 간의 관계를 설명하기.
- 활성화 함수의 포화와 연결하여 노름 증가가 모델 용량에 미치는 영향을 규명하기.
- 이론적 통찰을 L2 노름 증가와 유사한 형식적 성질을 가진 다른 아키텍처, 예를 들어 ReLU 피드포워드 네트워크로 확장하기.
제안 방법
- 훈련 도중 트랜스포머 파라미터의 L2 노름 증가 조건을 유도하기 위해 경사 하강법 역학에 대한 이론적 분석 수행.
- T5의 사전 훈련 도중 계층 간 노름 증가를 실증적으로 측정하며, 훈련 단계와 정확도 수준에 따른 변화 추적.
- 사전 훈련된 T5를 조각별로 일정한 활성화 함수를 가진 반-이산화된 네트워크로 모델링하여 포화 효과 분석.
- 자동기계 이론적 형식을 사용하여 포화된 네트워크의 용량을 원래 연속적 네트워크 가족과 비교.
- 훈련 정확도와 노름 증가 임계값 간의 관계를 분석하여, 더 높은 정확도가 더 큰 노름을 허용함을 보여줌.
- 이론적 발견을 피드포워드 ReLU 네트워크로 확장하여 트랜스포머 외부로도 일반화 가능성을 입증함.
실험 결과
연구 질문
- RQ1경사 하강법은 훈련 도중 트랜스포머 파라미터의 L2 노름에 어떻게 영향을 미치는가?
- RQ2훈련 정확도와 최적화 도중 도달 가능한 최대 파라미터 노름 간의 관계는 무엇인가?
- RQ3파라미터 노름 증가가 얼마나 네트워크 포화와 모델 용량 감소를 초래하는가?
- RQ4사전 훈련된 트랜스포머의 행동은 포화된 활성화를 가진 반-이산화된 네트워크로 모델링할 수 있는가?
- RQ5이 노름 증가 현상은 ReLU 피드포워드 네트워크와 같은 유사한 구조적 성질을 가진 다른 아키텍처로 일반화되는가?
주요 결과
- T5의 사전 훈련 도중 트랜스포머 파라미터의 L2 노름은 지속적으로 증가하며, 이 증가율과 정도는 훈련 정확도와 관련이 있다.
- 더 높은 훈련 정확도는 파라미터 노름이 더 높은 임계값까지 증가할 수 있도록 허용하여, 일반화 성능 향상이 더 큰 노름 값을 가능하게 함을 시사한다.
- 사전 훈련된 T5는 조각별 일정한 활성화 함수를 가진 반-이산화된 네트워크처럼 행동하여, 노름 증가로 인한 포화가 발생함을 시사한다.
- 포화된 네트워크는 원래의 연속적 네트워크 대비 용량이 감소하므로, 노름 증가가 구조적 인도적 편향을 유도함을 시사한다.
- 이론적 분석을 통해 이 노름 증가와 포화 효과가 트랜스포머에만 국한되지 않고, 유사한 형식적 성질을 가진 피드포워드 ReLU 네트워크에도 적용됨을 보여줌.
- 연구 결과는 경사 하강법이 모델을 포화된, 낮은 용량의 표현으로 편향시키며, 이는 높은 모델 용량에도 불구하고 일반화가 이루어지는 이유를 설명할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.