Skip to main content
QUICK REVIEW

[논문 리뷰] RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models

Jie Huang, Ping Wei|arXiv (Cornell University)|2023. 08. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 전결합형 인코더-디코더 언어 모델인 Raven을 제안하며, 검색 기반 마스킹 언어 모델링과 프리픽스 언어 모델링을 통해 컨텍스트 내 학습 능력을 향상시켜 사전학습-테스트 불일치와 제한된 컨텍스트 길이 문제를 해결한다. 재학습 없이도 더 많은 컨텍스트 예시를 활용할 수 있도록 하는 Fusion-in-Context Learning (FiCL)을 도입하여, 파arameter 수가 180배 적은데도 불구하고 훨씬 더 큰 모델들과 경쟁 가능한 성능을 달성한다.

ABSTRACT

In this paper, we investigate the in-context learning ability of retrieval-augmented encoder-decoder language models. We first conduct a comprehensive analysis of existing models and identify their limitations in in-context learning, primarily due to a mismatch between pretraining and inference, as well as a restricted context length. To address these issues, we propose RAVEN, a model that combines retrieval-augmented masked language modeling and prefix language modeling. We further introduce Fusion-in-Context Learning to enhance the few-shot performance by enabling the model to leverage more in-context examples without requiring additional training. Through extensive experiments, we demonstrate that our simple yet effective design significantly improves performance, achieving results comparable to the most advanced language models in certain scenarios, despite having substantially fewer parameters. Our work underscores the potential of retrieval-augmented encoder-decoder language models for in-context learning and encourages further research in this direction.

연구 동기 및 목표

  • 검색 기반 인코더-디코더 모델의 컨텍스트 내 학습 능력, 특히 최신 기술인 Atlas 모델의 성능 향상을 탐구하고 개선한다.
  • Atlas의 소수의 예시 학습 성능을 저해하는 사전학습-테스트 분포 불일치와 제한된 컨텍스트 길이 문제를 해결한다.
  • 모델 미세조정이나 아키텍처 변경 없이도 더 많은 컨텍스트 예시를 효과적으로 활용할 수 있는 방법을 개발한다.
  • 컨텍스트 예시 검색이 소수의 예시 학습 성능 향상에 미치는 역할을 탐색한다.
  • 더 작은, 검색 기반의 인코더-디코더 모델이 훨씬 더 큰 디코더 전용 모델들과 경쟁 가능한 성능을 달성할 수 있음을 보여준다.

제안 방법

  • Raven는 사전학습과 추론 분포를 일치시켜 사전학습-테스트 불일치를 줄이기 위해 검색 기반 마스킹 언어 모델링과 프리픽스 언어 모델링을 결합한다.
  • Fusion-in-Context Learning (FiCL)은 디코딩 중 동적으로 예시들을 융합함으로써 모델이 더 많은 컨텍스트 예시에서 정보를 참조하고 통합할 수 있도록 한다.
  • 모델는 추론 중 내부 검색기로 관련된 컨텍스트 예시를 검색하여 소수의 예시 학습 성능을 향상시킨다.
  • 아키텍처는 이중 방향 인코더와 디코더 내 융합 메커니즘을 활용하여 검색된 문단과 입력 컨텍스트를 효과적으로 통합한다.
  • 모델 재학습이나 수정 없이 추론 시점의 검색과 동적 융합에 의존함으로써 이 방법은 재학습이나 아키텍처 변경 없이도 가능하다.
  • 이 방법은 MMLU와 NQ를 포함한 제로샷 및 소수의 예시 설정 벤치마크에서 평가되었으며, 검색 및 컨텍스트 길이에 대한 분석도 수행되었다.
Figure 1: Pretraining task of Atlas and prompting strategies for in-context learning.
Figure 1: Pretraining task of Atlas and prompting strategies for in-context learning.

실험 결과

연구 질문

  • RQ1Atlas와 같은 검색 기반 인코더-디코더 모델이 컨텍스트 내 학습을 효과적으로 수행할 수 있으며, 그 주요 한계는 무엇인가?
  • RQ2사전학습-테스트 분포 불일치가 인코더-디코더 모델의 컨텍스트 내 학습 성능에 어떤 영향을 미치는가?
  • RQ3Fusion-in-Context Learning은 추가 학습이나 모델 변경 없이도 더 나은 소수의 예시 학습 성능을 가능하게 할 수 있는가?
  • RQ4추론 중 관련된 컨텍스트 예시를 검색하는 것이 소수의 예시 학습 성능을 추가로 향상시키는가?
  • RQ5더 작은, 검색 기반의 인코더-디코더 모델이 훨씬 더 큰 디코더 전용 모델과 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • FiCL를 사용할 경우 Raven는 제로샷 및 소수의 예시 설정에서 Atlas를 크게 앞서며, 11B 버전에서 MMLU에서 4.9점 향상되었다.
  • MMLU 벤치마크에서 Raven-11B는 FiCL를 사용해 5-shot 학습에서 50.5%의 정확도를 기록했으며, GPT-3 175B의 제로샷 성능(43.9%)을 초월하고 PaLM 62B(69.3%)에 가까워졌다.
  • 컨텍스트 예시 검색을 통해 Raven는 1-shot 학습에서 NQ에서 9.8%p의 절대적 성능 향상을 기록했으며, 관련 예시 검색의 가치를 입증했다.
  • GPT-3 175B보다 파arameter 수가 180배 적은데도 Raven-11B는 MMLU에서 유사한 소수의 예시 학습 성능을 달성하여 효율성을 입증했다.
  • Raven-3B의 제로샷 성능(45.7%)은 GPT-3 175B의 소수의 예시 성능(26.0%)을 초월하여, 미세조정 없이도 강력한 일반화 능력을 보였다.
  • FiCL 덕분에 11B 모델는 제로샷 성능보다 소수의 예시 학습 성능이 더 높아졌으며, 일반적으로 관찰되는 컨텍스트 내 학습의 성능 저하 경향을 뒤집었다.
Figure 2: Results of Atlas with different numbers of in-context examples.
Figure 2: Results of Atlas with different numbers of in-context examples.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.