Skip to main content
QUICK REVIEW

[논문 리뷰] The Transient Nature of Emergent In-Context Learning in Transformers

Aaditya K. Singh, Stephanie C. Y. Chan|arXiv (Cornell University)|2023. 11. 14.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 트랜스포머에서의 컨텍스트 내 학습(ICL)이 종종 일시적임을 보여주며, 훈련 중에만 나타나다가 손실 감소에도 불구하고 훈련이 계속됨에 따라 내부 가중치 학습(IWL)에 의해 대체됨을 밝힌다. 저자들은 L2 정규화가 ICL를 안정화시켜 사라짐을 방지하고, 조기 정지 없이 지속적인 ICL를 가능하게 한다고 제시한다.

ABSTRACT

Transformer neural networks can exhibit a surprising capacity for in-context learning (ICL) despite not being explicitly trained for it. Prior work has provided a deeper understanding of how ICL emerges in transformers, e.g. through the lens of mechanistic interpretability, Bayesian inference, or by examining the distributional properties of training data. However, in each of these cases, ICL is treated largely as a persistent phenomenon; namely, once ICL emerges, it is assumed to persist asymptotically. Here, we show that the emergence of ICL during transformer training is, in fact, often transient. We train transformers on synthetic data designed so that both ICL and in-weights learning (IWL) strategies can lead to correct predictions. We find that ICL first emerges, then disappears and gives way to IWL, all while the training loss decreases, indicating an asymptotic preference for IWL. The transient nature of ICL is observed in transformers across a range of model sizes and datasets, raising the question of how much to "overtrain" transformers when seeking compact, cheaper-to-run models. We find that L2 regularization may offer a path to more persistent ICL that removes the need for early stopping based on ICL-style validation tasks. Finally, we present initial evidence that ICL transience may be caused by competition between ICL and IWL circuits.

연구 동기 및 목표

  • 트랜스포머에서의 컨텍스트 내 학습(ICL)이 훈련 기간 동안 지속적인 현상인지 일시적인 현상인지 조사하기.
  • ICL가 나타나고 나서도 손실 감소가 계속됨에도 불구하고 사라지는 조건을 분석하기.
  • 최적화 동역학에 기인해 IWL이 점차 ICL를 압도하는지 여부를 탐구하기.
  • L2와 같은 정규화 기법이 ICL를 안정화시키고 일시성 방지에 기여하는지 평가하기.
  • 트랜스포머 잔류 스트림 내 ICL과 IWL 회로 간의 경쟁 가능성을 조사하기.

제안 방법

  • 저자들은 ICL과 IWL이 모두 높은 정확도를 달성하는 데 유리한 합성적, 급격한 소수 샘플 분류 데이터셋에서 트랜스포머를 훈련시켰다.
  • 훈련 전반에 걸쳐 독립적으로 ICL 및 IWL 성능을 측정하기 위해 별도의 평가 헤드를 사용하여 정확도 변화를 시간에 따라 추적했다.
  • 훈련 손실을 모니터링하고, 다양한 모델 크기와 데이터 분포를 대상으로 모델 행동을 평가하여 일반화 가능성 여부를 분석했다.
  • ICL의 안정성 향상과 사라짐 방지를 위해 훈련 중 L2 정규화를 적용했다.
  • 잔류 스트림 내 ICL과 IWL 회로 간의 경쟁을 분석하고, 자원 제약이 점차적으로 IWL을 유리하게 만들 것이라는 가설을 세웠다.
  • 실제 LLM에 더 가까운 설정에서 ICL의 일시성 여부를 검증하기 위해 언어 모델 토큰 임베딩으로 실험을 확장했다.

실험 결과

연구 질문

  • RQ1트랜스포머에서 컨텍스트 내 학습(ICL)은 점차적으로 지속되는가, 아니면 훈련 도중에 나타나고 사라지는가?
  • RQ2훈련 손실이 계속 감소함에도 불구하고 ICL이 사라지는 이유는 무엇인가, 이는 계속 최적화가 이루어지고 있음을 시사한다.
  • RQ3ICL의 일시성은 ICL과 내부 가중치 학습(IWL) 회로 간의 경쟁으로 설명될 수 있는가?
  • RQ4L2 정규화와 같은 정규화 기법이 ICL를 안정화시키고 사라짐을 방지할 수 있는가?
  • RQ5데이터 분포(예: 급격한 분포, 클래스 편향)는 ICL의 등장과 일시성에 어느 정도 영향을 미치는가?

주요 결과

  • ICL는 훈련 도중에 먼저 나타나지만, 손실 감소가 계속됨에도 불구하고 완전히 사라지며, 이는 ICL가 점차적으로 선호되지 않는다는 것을 시사한다.
  • 훈련이 진행됨에 따라 내부 가중치 학습(IWL)이 ICL를 지속적으로 압도하며, 이는 표준 교차 엔트로피 훈련 하에서 IWL이 점차적으로 유리하다는 것을 시사한다.
  • ICL의 일시성은 여러 모델 크기와 데이터셋에서 관찰되어 트랜스포머에서 일반적인 현상임을 입증한다.
  • L2 정규화는 ICL를 효과적으로 안정화시켜 사라짐을 방지하고, 조기 정지 없이 지속적인 컨텍스트 내 학습을 가능하게 한다.
  • 결과는 ICL과 IWL 회로 간의 잔류 스트림 내 경쟁이 ICL의 일시성의 근본 원인일 수 있으며, 소프트 어텐션 메커니즘의 제약으로 인해 IWL이 지배력을 확보한다는 것을 시사한다.
  • 초기 증거는 정규화가 ICL의 일시성을 완화시킬 수 있음을 시사하지만, 이는 IWL 성능 저하를 수반한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.