Skip to main content
QUICK REVIEW

[논문 리뷰] Active Example Selection for In-Context Learning

Yiming Zhang, Feng Shi|arXiv (Cornell University)|2022. 11. 08.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 인컨텍스트 학습을 위한 강화학습 기반의 능동적 예시 선택 방법을 제안하며, 예시 선택을 순차적 결정 문제로 프레임워크하여 모델의 일반화 능력을 향상시킨다. 이는 GPT-2에서 미리보지 않은 작업들에 대해 평균 5.8%의 정확도 향상을 달성했으며, GPT-3 Ada에서는 소규모 향상이 있었고, 더 큰 GPT-3 모델에서는 수익 감소 현상이 나타나, 더 큰 모델에서 나타나는 새로운 능력들을 강조한다.

ABSTRACT

With a handful of demonstration examples, large-scale language models show strong capability to perform various tasks by in-context learning from these examples, without any fine-tuning. We demonstrate that in-context learning performance can be highly unstable across samples of examples, indicating the idiosyncrasies of how language models acquire information. We formulate example selection for in-context learning as a sequential decision problem, and propose a reinforcement learning algorithm for identifying generalizable policies to select demonstration examples. For GPT-2, our learned policies demonstrate strong abilities of generalizing to unseen tasks in training, with a $5.8\%$ improvement on average. Examples selected from our learned policies can even achieve a small improvement on GPT-3 Ada. However, the improvement diminishes on larger GPT-3 models, suggesting emerging capabilities of large language models.

연구 동기 및 목표

  • 증거 예시 선택으로 인한 인컨텍스트 학습 성능의 불안정성 원인을 탐구하기 위해.
  • 다양한 작업 간에 효과적인 증거 예시를 선택하는 일반화 가능한 전략을 개발하기 위해.
  • 강화학습이 저샷 인컨텍스트 학습에서 능동적 예시 선택을 위한 체계적이고 이식 가능한 정책을 발견할 수 있는지 탐색하기 위해.
  • GPT-2와 더 큰 GPT-3 모델이 예시 선택에 반응하는 방식을 비교하여, 잠재적 능력의 차이를 드러내기 위해.
  • 대규모 언어 모델이 인컨텍스트에서 정보를 어떻게 습득하는지 이해하고, 대규모 모델 시대의 향후 연구에 통찰을 제공하기 위해.

제안 방법

  • 강화학습을 사용하여 능동적 예시 선택을 순차적 결정 문제로 공식화한다.
  • 예측된 모델 성능에 기반해 풀에서 반복적으로 미레이블 예시를 선택하는 정책 네트워크를 훈련시킨다.
  • 훈련 중에 검증 세트에서의 인컨텍스트 학습 정확도에 기반한 보상 신호를 사용한다.
  • 훈련된 정책을 사용해 새로운 작업이나 미레이블 예시 풀에서 예시를 선택하고, 제로샷 일반화를 평가한다.
  • 정책이 점차 복잡해지는 작업들에서 학습하는 커리큘럼 스타일의 훈련 설정을 사용한다.
  • GPT-2에서 4샷 인컨텍스트 학습을 사용해 정책을 검증하고, 새로운 작업으로의 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1GPT-2에 대해 다양한 증거 예시 세트를 사용했을 때 인컨텍스트 학습 성능가 어떻게 달라지나?
  • RQ2강화학습이 다양한 작업 간에 인컨텍스트 학습을 향상시키는 데 효과적인 일반화 가능한 정책을 발견할 수 있는가?
  • RQ3유용한 증거 예시의 특성은 인간의 직관과 어떻게 다를까?
  • RQ4학습된 예시 선택의 성능 향상은 모델 규모에 따라 어떻게 달라지며, 특히 GPT-2와 더 큰 GPT-3 모델 간의 차이가 어떻게 나타나는가?
  • RQ5GPT-2에서 훈련된 정책이 GPT-3 모델으로 일반화되는 정도는 어느 정도이며, 왜 더 큰 모델에서는 성능 향상이 감소하는가?

주요 결과

  • GPT-2에서 인컨텍스트 학습 성능는 다양한 증거 예시 세트에 따라 높은 변동성을 보이며, 정보 습득의 불안정성을 나타낸다.
  • 제안된 강화학습 기반의 능동적 예시 선택 정책은 GPT-2에서 새로운 작업들에 대해 평균 5.8%의 인컨텍스트 학습 정확도 향상을 달성한다.
  • GPT-2에서 레이블이 부여된 데이터셋이 있는 볼 수 있는 작업에서, 최대 엔트로피 능동 학습 기반 보다 12.1% 향상된 성능을 기록한다.
  • 학습된 정책에 의해 선택된 예시들은 GPT-3 Ada에서 소규모이지만 측정 가능한 향상을 이끌어내어, 학습된 선택 전략의 이식 가능성 잠재력을 보여준다.
  • 더 큰 GPT-3 모델들(예: Babbage 및 Curie)에서는 성능 향상이 크게 감소함을 확인하여, 예시를 정교하게 선별할 필요성이 줄어드는 새로운 능력이 나타나고 있음을 시사한다.
  • 분석 결과, 효과적인 증거 예시는 종종 인간의 직관과 다름을 보이며, 효과적인 인컨텍스트 학습에서 비트레이스러운 패턴이 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.