Skip to main content
QUICK REVIEW

[논문 리뷰] Are Emergent Abilities of Large Language Models a Mirage?

Rylan Schaeffer, Brando Miranda|arXiv (Cornell University)|2023. 04. 28.
Topic Modeling인용 수 132
한 줄 요약

본 논문은 대형 언어 모델의 소위 emergent 능력이 기본적인 스케일링이 아니라 지표 선택과 데이터의 한계에서 비롯된다고 주장한다. 간단한 수학적 모델과 세 가지 보완 실험을 제시하여 선형/연속 지표, 더 나은 통계, 혹은 비전 작업에서 emergent 능력이 사라질 수 있음을 보인다.

ABSTRACT

Recent work claims that large language models display emergent abilities, abilities not present in smaller-scale models that are present in larger-scale models. What makes emergent abilities intriguing is two-fold: their sharpness, transitioning seemingly instantaneously from not present to present, and their unpredictability, appearing at seemingly unforeseeable model scales. Here, we present an alternative explanation for emergent abilities: that for a particular task and model family, when analyzing fixed model outputs, emergent abilities appear due to the researcher's choice of metric rather than due to fundamental changes in model behavior with scale. Specifically, nonlinear or discontinuous metrics produce apparent emergent abilities, whereas linear or continuous metrics produce smooth, continuous predictable changes in model performance. We present our alternative explanation in a simple mathematical model, then test it in three complementary ways: we (1) make, test and confirm three predictions on the effect of metric choice using the InstructGPT/GPT-3 family on tasks with claimed emergent abilities; (2) make, test and confirm two predictions about metric choices in a meta-analysis of emergent abilities on BIG-Bench; and (3) show to choose metrics to produce never-before-seen seemingly emergent abilities in multiple vision tasks across diverse deep networks. Via all three analyses, we provide evidence that alleged emergent abilities evaporate with different metrics or with better statistics, and may not be a fundamental property of scaling AI models.

연구 동기 및 목표

  • emergent 능력이 모델 스케일링의 고유한 특성인지가 측정의 산물인지에 대한 의문 제기.
  • per-token 오차, 지표 선택, 관찰된 emergent 현상 간의 연관성을 설명하는 수학적 모델 제안.
  • InstructGPT/GPT-3를 사용한 예측 검증을 통해 지표가 emergent 산술 능력에 미치는 영향을 평가.
  • BIG-Bench 결과에 대한 메타 분석을 통해 emergent 능력의 지표 의존성 평가.
  • 평가 지표를 바꿔 시각 과제에서 induced emergent 능력을 시연.

제안 방법

  • 모델 크기 N에 대해 크로스 엔트로피 손실 L_CE(N)가 멱법칙을 따르는 간단한 수학적 모델을 제시하고, 비선형 또는 불연속 지표 하에서 작업 점수로의 비선형 매핑을 유발한다.
  • 비선형 지표(예: 긴 시퀀스의 정확도)와 불연속 지표(예: 객관식 등급)가 작은 모델에서 큰 모델로의 날카롭고 emergent처럼 보이는 전이를 만들어낼 수 있음을 보인다.
  • 연속적/선형 지표(예: 토큰 편집 거리, Brier 점수)가 규모 확장에 따라 부드럽고 예측 가능한 향상을 유발하여 emergent 현상을 약화시킨다.
  • InstructGPT/GPT-3에 대한 세 가지 예측을 테스트: 지표 변화로 부드러운 향상 관찰; 해상도가 높은 통계로 비선형 지표에서 작은 모델의 비영이 0이 아님을 보여줄 가능성; 대상 길이가 성능에 예측 가능한 영향을 미침.
  • BIG-Bench 결과를 메타 분석하여 emergent 능력이 주로 소수의 비선형/불연속 지표에서 나타나고 연속 지표에서는 사라짐을 확인.
  • 재구성과 순차 분류 작업에 대해 불연속 지표를 설계함으로써 다양한 아키텍처에서 비전 모델의 emergent 능력을 유도하는 방법을 제시.

실험 결과

연구 질문

  • RQ1Emergent 능력이 모델 성능 평가에 사용된 지표에 의존하는가?
  • RQ2비선형 또는 불연속 지표가 모델 스케일에서 뚜렷한 전이를 만들어내고, 선형/연속 지표에서는 이를 사라지게 만드는가?
  • RQ3더 높은 해상도의 통계(더 많은 테스트 데이터)가 emergent 능력이 주장되는 작업에서 작은 모델의 비영 성능을 드러내는가?
  • RQ4평가 지표를 바꿔 시각 분야에서도 emergent 능력을 유도할 수 있는가?
  • RQ5BIG-Bench의 emergent 주장은 지표 선택과 모델 계열에 얼마나 견고한가?

주요 결과

  • Emergent 능력은 Exact String Match 및 Multiple Choice Grade와 같은 비선형 또는 불연속 지표에서 주로 나타난다.
  • 테스트 데이터 해상도 증가가 작은 모델의 - 확률적으로 - 우연이 아닌 성능을 드러냄으로써 비선형 지표로 측정될 때 비영성 능력이 존재함을 시사한다.
  • 선형 또는 연속 지표(예: 토큰 편집 거리 또는 Brier 점수)로 전환하면 부드럽고 예측 가능한 향상을 초래하여 emergent 효과를 약화시킨다.
  • 메타 분석에 따르면 emergent 능력은 지표의 일부에서만 나타나며, 두 가지 지표(Multiple Choice Grade 및 Exact String Match)가 대부분의 주장된 emergent 능력을 차지한다.
  • 적절한 평가 기준을 설계함으로써 다양한 아키텍처의 비전 모델에서도 emergent와 유사한 능력을 유도할 수 있다.
  • InstructGPT/GPT-3에 대한 실증 결과는 더 나은 통계 및 지표 변화로 emergent 능력이 사라짐을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.