[논문 리뷰] A Constructive Prediction of the Generalization Error Across Scales
논문은 모델 크기와 데이터 크기에 모두 의존하는 일반화 오차를 위한 간단하고 예측 가능한 함수 형태를 제안하여, 고정된 스케일링 정책 하에서 작은 규모에서 큰 규모로의 외삽을 가능하게 한다.
The dependency of the generalization error of neural networks on model and dataset size is of critical importance both in practice and for understanding the theory of neural networks. Nevertheless, the functional form of this dependency remains elusive. In this work, we present a functional form which approximates well the generalization error in practice. Capitalizing on the successful concept of model scaling (e.g., width, depth), we are able to simultaneously construct such a form and specify the exact models which can attain it across model/data scales. Our construction follows insights obtained from observations conducted over a range of model/data scales, in various model types and datasets, in vision and language tasks. We show that the form both fits the observations well across scales, and provides accurate predictions from small- to large-scale models and data.
연구 동기 및 목표
- 스케일링 정책 하에서 일반화 오차가 모델 크기와 데이터셋 크기에 함께 어떻게 의존하는지 이해한다.
- 비전 및 언어 작업 전반에서 오차 지형을 적합시키는 간단하고 해석 가능한 함수 형태를 제안한다.
- 제시된 형태가 다양한 규모에 대해 일반화 오차를 높은 정확도로 보간(interpolate)하고 외삽할 수 있음을 보인다.
제안 방법
- 비전과 언어의 여러 데이터셋과 모델에 걸친 오차 지형을 실증적으로 분석하여 스케일링 패턴을 식별한다.
- 데이터 크기와 모델 크기에 대한 멱법칙 항을 전이 엔벨로프를 포함하는 매개변수형 오차 함수를 제안한다.
- 작은 규모의 측정값에 10-fold 교차 검증을 사용해 함수를 적합시키고 데이터셋 전반에 걸친 적합 품질을 평가한다.
- 관찰된 규모에서 보이지 않는 큰 규모 구성으로의 외삽을 시연하고 예측 정확도를 평가한다.
실험 결과
연구 질문
- RQ1주어진 스케일링 정책 하에서 일반화 오차, 모델 크기, 데이터셋 크기 사이의 함수적 관계는 무엇인가?
- RQ2간단한 매개변수 형태가 비전과 언어 작업 모두에서 오차 지형을 정확하게 적합시키고 예측할 수 있는가?
- RQ3제안된 스케일링 정책 하에서 작은 규모의 측정이 대규모 성능을 어느 정도까지 예측할 수 있는가?
- RQ4작은 규모 데이터에 적합시켰을 때 모델은 보이지 않는(더 큰) 규모에 얼마나 잘 일반화되는가?
주요 결과
- 오차 지형은 데이터 크기와 모델 크기에 대해 멱법칙 거동이 다른 하나를 고정한 채로 오차를 근사하는 영역을 보인다.
- 제안된 함수 ε(m, n) ≈ a(m)n^(-α(m)) + b(n)m^(-β(n)) + c_infty가 모델 및 데이터 크기에 따른 오차의 공동 의존성을 포착한다.
- 엔벨로프는 초기 무작위 추정 오차에서 멱법칙 영역으로의 매끄러운 전이를 가능하게 하여 규모에 걸친 실용적인 적합을 가능하게 한다.
- 데이터셋 전반에서 추정된 오차와 실제 오차의 평균 차이는 대부분의 경우 1% 미만이며 표준편차는 5% 미만이다.
- 작은 규모에서 큰 규모로의 외삽은 평균 차이가 몇 퍼센트 수준으로 달성된다(예: ImageNet에서 4.5%, WikiText-103에서 0.5%) 여러 구성에서.
- 이 방법은 ResNet, WRN, VGG, DenseNet, AWD-LSTM, Transformer 계열 등을 포함한 여러 아키텍처와 옵티마이저에서도 여전히 정확하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.