Skip to main content
QUICK REVIEW

[논문 리뷰] Broken Neural Scaling Laws

Ethan Caballero, Kshitij Gupta|arXiv (Cornell University)|2022. 10. 26.
Neural Networks and Applications인용 수 14
한 줄 요약

이 논문은 다양한 작업과 아키텍처를 통해 딥러닝 스케일링 행동을 모델링하고 외삽하는 데 사용할 수 있는 부드럽게 조각된 거듭제곱법 함수 형태인 깨진 신경 스케일링 법칙(Broken Neural Scaling Laws, BNSL)을 소개한다. BNSL는 이전에 표준 거듭제곱법으로 모델링되지 않았던 비단조화적 현상인 더블 디센트와 날카러운 꺾임점(또는 전환점)을 포착하여, 시각, 언어, 오디오, 로봇공학, AI 정합성 작업 등 다양한 분야에서 외삽 정확도가 뛰어나며, 계산 자원 규모가 100,000배 이상 증가하는 경우에도 성능을 잘 예측한다.

ABSTRACT

We present a smoothly broken power law functional form (that we refer to as a Broken Neural Scaling Law (BNSL)) that accurately models & extrapolates the scaling behaviors of deep neural networks (i.e. how the evaluation metric of interest varies as amount of compute used for training (or inference), number of model parameters, training dataset size, model input size, number of training steps, or upstream performance varies) for various architectures & for each of various tasks within a large & diverse set of upstream & downstream tasks, in zero-shot, prompted, & finetuned settings. This set includes large-scale vision, language, audio, video, diffusion, generative modeling, multimodal learning, contrastive learning, AI alignment, AI capabilities, robotics, out-of-distribution (OOD) generalization, continual learning, transfer learning, uncertainty estimation / calibration, OOD detection, adversarial robustness, distillation, sparsity, retrieval, quantization, pruning, fairness, molecules, computer programming/coding, math word problems, "emergent phase transitions", arithmetic, supervised learning, unsupervised/self-supervised learning, & reinforcement learning (single agent & multi-agent). When compared to other functional forms for neural scaling, this functional form yields extrapolations of scaling behavior that are considerably more accurate on this set. Moreover, this functional form accurately models & extrapolates scaling behavior that other functional forms are incapable of expressing such as the nonmonotonic transitions present in the scaling behavior of phenomena such as double descent & the delayed, sharp inflection points present in the scaling behavior of tasks such as arithmetic. Lastly, we use this functional form to glean insights about the limit of the predictability of scaling behavior. Code is available at https://github.com/ethancaballero/broken_neural_scaling_laws

연구 동기 및 목표

  • 딥러닝 스케일링에서 비단조화적 행동과 꺾임점 행동을 모델링하는 데 있어 전통적인 거듭제곱법 스케일링 법칙의 한계를 해결하기 위해.
  • 광범위한 AI 작업과 아키텍처 전반에서 스케일링 행동을 정확하게 모델링하고 외삽할 수 있는 기능 형태를 개발하기 위해.
  • 특히 잠재 능력과 안전에 중대한 영향을 미치는 행동에 대해 스케일링 시 성능을 신뢰성 있게 예측할 수 있도록 하기 위해.
  • 기존 모델이 다루지 못하는 영역, 특히 극단적인 스케일 외삽(예: 훈련 데이터보다 100,000배 큰 규모)까지도 통합된 프레임워크를 제공하기 위해.

제안 방법

  • 로그-로그 공간에서 조각별 선형 함수로 표현되는 부드러운 깨진 거듭제곱법(BNSL)을 제안하여, 기울기가 다른 여러 구간을 부드럽게 연결함으로써 스케일링 행동의 급격하거나 점진적인 변화를 모델링할 수 있도록 한다.
  • 각 구간에서 y = a + b * x^(-c) 형태의 함수를 정의하고, 기울기가 변화하는 지점(즉, 꺾임점)을 설정함으로써 스케일링 행동의 급격하거나 점진적인 변화를 모델링할 수 있도록 한다.
  • 실제 데이터에서 파arameter(a, b, c 및 꺾임점)를 추정하기 위해 비선형 최소 제곱법(SciPy를 통해 구현)을 사용한다.
  • 실제 데이터셋과 발표된 결과를 사용하여 시각, 언어, 오디오, 로봇공학, 강화학습, AI 정합성 등 다양한 작업에 걸쳐 30개 이상의 작업에서 모델을 검증한다.
  • BNSL의 외삽 성능을 표준 거듭제곱법 및 기타 기능 형태와 비교하여, 제로샷, 프롬프트 기반, 파인튜닝 설정에서 평가한다.
  • GPT-4 및 기타 대규모 모델에 대해 관측된 최대 스케일보다 100,000배 이상 큰 스케일까지도 BNSL을 적용하여 스케일링 곡선을 외삽한다.

실험 결과

연구 질문

  • RQ1더블 디센트나 지연된 꺾임점과 같은 비단조화적 스케일링 행동을 정확하게 모델링하고 외삽할 수 있는 기능 형태를 개발할 수 있는가?
  • RQ2특히 급격한 전환점이나 복잡한 스케일링 역학을 보이는 작업에서, BNSL은 관측된 데이터 범위를 초월해 스케일링 법칙을 어떻게 외삽하는가?
  • RQ3BNSL은 시각, 언어, 오디오, 다중모odal 학습 등 다양한 AI 작업에서 제로샷, 프롬프트 기반, 파인튜닝 설정 전반에 걸쳐 얼마나 일반화되는가?
  • RQ4기존 거듭제곱법보다 BNSL이 극단적인 스케일(예: 훈련 데이터보다 100,000배 큰 규모)에서 스케일링 행동을 더 정확하게 예측할 수 있는가?
  • RQ5BNSL은 딥러닝 시스템의 스케일링 행동 예측 한계에 대해 어떤 통찰을 제공하는가?

주요 결과

  • BNSL은 시각, 언어, 오디오, 로봇공학, AI 정합성 등 30개 이상의 다양한 AI 작업에서 스케일링 행동을 정확하게 모델링하고 외삽하며, 기존 거듭제곱법보다 뛰어난 성능을 보인다.
  • BNSL는 이전에 표준 거듭제곱법으로 표현되지 못했던 비단조화적 행동, 예를 들어 더블 디센트와 날카로운 꺾임점을 성공적으로 포착한다.
  • 스케일링 법칙 벤치마크(Alabdulmohsin 등, 2022)에서, BNSL은 ImageNet, CIFAR-100, Caltech101, BIG-Bench에 대해 정확한 외삽을 수행하였으며, 꺾임점 근처 데이터가 부족한 경우 소수의 실패 사례 외에는 거의 오류 없이 성능을 발휘하였다.
  • 하위 작업인 언어 및 프로그래밍 작업에서는, GPT-4의 훈련 계산 자원과 성능 데이터를 기반으로 관측된 최대 스케일보다 100,000배 이상 큰 계산 자원 규모까지도 BNSL이 스케일링 곡선을 외삽하였다.
  • 특히 극단적 스케일에서의 성능 예측 및 단계 전환기 동안 BNSL은 다른 기능 형태보다 뛰어난 외삽 정확도를 보였다.
  • 모델는 스케일링 행동이 항상 단조롭지 않으며, 스케일링 곡선의 꺾임점은 흔하고 예측 가능한 경향이 있음을 드러내어, 향후 모델 개발 시 이러한 구조적 전환을 고려해야 한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.