[논문 리뷰] In-Context Learning with Many Demonstration Examples
이 논문은 원형 위치 임베딩과 점진적 인코딩을 통해 최대 256k의 컨텍스트 길이를 지원하는 효율적인 트랜스포머 아키텍처 기반의 장거리 언어 모델인 EvaLM을 소개한다. 이는 많은 예시를 포함한 컨텍스트 내 학습에서 높은 성능을 발휘하며, 유사 모델 대비 평균 정확도가 4.1% 높고, 효율적인 추론 및 외삽 기법 덕분에 계산 오버헤드가 최소화된다.
Large pre-training language models (PLMs) have shown promising in-context learning abilities. However, due to the backbone transformer architecture, existing PLMs are bottlenecked by the memory and computational cost when scaling up to a large context size, leaving instruction tuning and in-context learning of many demonstration examples, as well as long-range language modeling under-explored. In this study, we propose a long-range language model EVALM based on an efficient transformer mechanism. EVALM is trained with 8k tokens per batch line and can test up to 256k-lengthed contexts with extrapolation, 128 times to the limit of existing PLMs (e.g. GPT3). Based on EVALM, we scale up the size of examples efficiently in both instruction tuning and in-context learning to explore the boundary of the benefits from more annotated data. Experimental results on a diverse set of tasks show that EVALM achieves 4.1% higher accuracy on average, and the average length of achieving the best accuracy score over tasks is around 12k. We find that in-context learning can achieve higher performance with more demonstrations under many-shot instruction tuning (8k), and further extending the length of instructions (16k) can further improve the upper bound of scaling in-context learning.
연구 동기 및 목표
- 표준 트랜스포머 아키텍처로 인해 발생하는 장거리 컨텍스트 내 학습(ICL)에서의 계산 및 메모리 병목 현상을 해결하기 위해.
- 시범 예제의 수를 늘일 때 컨텍스트 내 학습의 성능 한계를 탐색하기 위해.
- 경량적이고 확장 가능한 언어 모델을 사용해 지시 테이닝 및 ICL를 위한 효율적이고 외삽 가능한 장거리 컨텍스트 모델링을 가능하게 하기 위해.
- 장거리 컨텍스트 환경에서 샷 수와 지시어 길이를 늘일수록 ICL 성능이 향상되는지 조사하기 위해.
제안 방법
- 외삽 가능한 위치 임베딩을 지원하기 위해 수정된 효율적 트랜스포머 메커니즘(EVA)을 사용해 EvaLM을 사전학습한다.
- 원형 위치 임베딩을 도입하여 훈련 시퀀스를 초월한 더 긴 컨텍스트 길이로의 일반화를 가능하게 한다.
- 시범 예제의 인코딩된 표현을 캐시하고 재사용함으로써 추론 중의 중복 계산을 줄이기 위해 점진적 인코딩을 적용한다.
- 최대 8k-샷 시범 예제를 사용해 다수 샷 지시 테이닝(MSIT)으로 미세조정하여 컨텍스트 내 학습 성능을 향상시킨다.
- 다양한 프롬프팅 전략을 사용해 10개의 다양한 NLP 작업에서 확장성과 효과성을 평가하기 위해 실험를 수행한다.
- 훈련 FLOPs와 추론 시간을 측정하여 EvaLM을 OPT 및 기타 베이스라인과 비교함으로써 효율성을 평가한다.

실험 결과
연구 질문
- RQ1소수 샷 설정을 초월해 시범 예제의 수를 늘릴 경우 컨텍스트 내 학습 성능을 크게 향상시킬 수 있는가?
- RQ2장거리 시나리오에서 지시어 길이를 늘일수록 다수 샷 지시 테이닝으로부터 얻는 성능 향상은 어떻게 영향을 받는가?
- RQ3효율적인 어텐션 메커니즘과 외삽 기법이 사전 학습된 언어 모델에서 장거리 컨텍스트 모델링을 얼마나 잘 가능하게 하는가?
- RQ4다수 샷 시범 예제를 사용한 컨텍스트 내 학습을 확장할 경우 계산 비용은 어떻게 되며, 이를 효율적으로 만들 수 있는가?
주요 결과
- EvaLM는 다수 샷 지시 테이닝을 사용할 경우 OPT와 같은 유사 모델 대비 10개의 다양한 NLP 작업에서 평균 정확도가 4.1% 높게 기록된다.
- 작업 전반에서 최고 정확도에 도달하기 위해 필요한 평균 입력 길이는 약 12k 토큰이며, 이는 성능 향상이 스케일에 따라 나타남을 시사한다.
- 다수 샷 지시 테이닝은 특히 더 긴 지시어(최대 16k 토큰)와 조합될 경우 컨텍스트 내 학습 성능을 크게 향상시키며, 더 두드러진 효과를 보인다.
- 점진적 인코딩과 캐싱 덕분에 소수 샷에서 다수 샷 ICL로 확장할 경우 계산 오버헤드가 최소화되어 장거리 추론에 실용적으로 적용 가능하다.
- 원형 위치 임베딩을 사용해 EvaLM은 기존 모델들인 GPT-3(2048 토큰)보다 128배 긴 256k 길이의 컨텍스트로 외삽에 성공했으며, 이는 성능 향상에 기여한다.
- 샷 수를 늘릴수록 성능 향상이 무한히 지속되지 않음을 확인했으며, 이는 더 이상의 개선 효과가 감소하는趋세를 보이는 포화점이 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.