Skip to main content
QUICK REVIEW

[논문 리뷰] Learning To Retrieve Prompts for In-Context Learning

Ohad Rubin, Jonathan Herzig|arXiv (Cornell University)|2021. 12. 16.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 EPR(Efficient Prompt Retrieval)를 제안하며, 언어 모델을 스코어링 함수로 사용하여 올바른 출력을 생성할 가능성에 따라 훈련 예제를 좋은 프롬프트 또는 나쁜 프롬프트로 레이블링한다. 이 레이블을 바탕으로 대조 학습을 통해 밀도형 리트리버를 훈련시켜 세 개의 시퀀스-투-시퀀스 작업에서 인라인 학습 성능을 크게 향상시킨다. 이는 이전 베이스라인 대비 Break에서 최대 7.7% 향상되고 MTop에서 7.2% 향상된 결과를 보였다.

ABSTRACT

In-context learning is a recent paradigm in natural language understanding, where a large pre-trained language model (LM) observes a test instance and a few training examples as its input, and directly decodes the output without any update to its parameters. However, performance has been shown to strongly depend on the selected training examples (termed prompt). In this work, we propose an efficient method for retrieving prompts for in-context learning using annotated data and a LM. Given an input-output pair, we estimate the probability of the output given the input and a candidate training example as the prompt, and label training examples as positive or negative based on this probability. We then train an efficient dense retriever from this data, which is used to retrieve training examples as prompts at test time. We evaluate our approach on three sequence-to-sequence tasks where language utterances are mapped to meaning representations, and find that it substantially outperforms prior work and multiple baselines across the board.

연구 동기 및 목표

  • 인라인 학습 성능이 소수의 훈련 예제(프롬프트) 선택에 크게 의존한다는 핵심 과제를 해결하기 위해.
  • 모델 파라미터에 접근할 수 없거나 파라미터 튜닝이 불가능한 환경에서도 고품질 프롬프트를 검색할 수 있는 방법을 개발하기 위해.
  • 언어 모델이 생성한 지도를 사용하여 경량이고 효율적인 밀도형 리트리버를 훈련시켜 프롬프트 선택을 최적화하기 위해.
  • 특히 모델 가중치에 접근이 불가능한 환경(예: API 전용 사용)에서 대규모 언어 모델과 효과적으로 상호작용할 수 있도록 하기 위해.
  • 구조적 시퀀스-투-시퀀스 작업, 예를 들어 의미 해석 및 작업 지향 대화와 같은 분야에서 성능 향상시키기 위해.

제안 방법

  • 각 훈련 예제 (x, y)에 대해, 이 방법은 비지도 리트리버를 사용해 훈련 세트에서 후보 프롬프트를 검색한다.
  • 스코어링 언어 모델이 각 후보 프롬프트에 대해 P(y|x, prompt)를 추정하며, 입력 x와 프롬프트가 주어졌을 때 올바른 출력 y가 발생할 가능성을 측정한다.
  • P(y|x, prompt)가 높은 프롬프트는 양성으로 레이블링되고, 확률이 낮은 프롬프트는 음성으로 레이블링된다.
  • 레이블된 데이터를 바탕으로 대조 학습 목표를 사용해 밀도형 리트리버를 훈련시키며, 테스트 시에 고품질 프롬프트를 검색할 수 있도록 학습한다.
  • 스코어링 LM은 추론 LM보다 작을 수 있으며, 이는 효율적인 데이터 생성을 가능하게 하며, 동일한 모델일 수도 있다. 이 경우 API 기반 배포에 적합하다.
  • 최종 리트리버는 추론 시에 테스트 입력에 대해 가장 관련성이 높은 훈련 예제를 프롬프트로 검색하는 데 사용된다.

실험 결과

연구 질문

  • RQ1언어 모델을 사용해 인라인 학습에서 프롬프트 리트리버를 훈련하기 위한 고품질 지도를 생성하는 데 효과적인가?
  • RQ2프롬프트 품질에 대해 언어 모델이 생성한 레이블을 사용할 경우, 표면 유사성 히وري스틱보다 더 나은 검색 성능을 내는가?
  • RQ3언어 모델 지도를 기반으로 훈련된 경량 리트리버가 최종 시퀀스-투-시퀀스 작업에서 베이스라인을 능가할 수 있는가?
  • RQ4스코어링 LM이 추론 LM보다 작거나, 동일한 경우(예: GPT-3)에 이 방법의 효과는 어느 정도인가?
  • RQ5추론 시 리트리버가 고순위 프롬프트에 얼마나 의존하는가? 그리고 정확한 패턴 복사 외에도 일반화되는가?

주요 결과

  • GPT-Neo를 스코어링 및 추론 LM으로 사용할 경우, Break 벤치마크에서 인라인 학습 성능이 5.9%p 향상되어 정확도가 26%에서 31.9%로 상승했다.
  • MTop 데이터셋에서 EPR는 7.2%p 향상되어 동일한 설정에서 정확도가 57%에서 64.2%로 상승했다.
  • SMCalFlow에서 EPR는 성능을 51.4%에서 54.3%로 향상시켜 다양한 작업에서 일관된 성과를 보였다.
  • GPT-J, GPT-3, Codex와 같은 더 큰 모델을 대체로 GPT-Neo를 프록시로 사용할 경우에도 EPR는 여전히 상당한 성능 향상을 기록했으며, 다양한 모델 규모에서의 강건성을 입증했다.
  • Break에서 복사 거리 분포를 통해 리트리버가 주로 고순위 프롬프트에서 복사하는 것으로 나타났으며, 이는 의미적으로 관련성이 높은 예제를 효과적으로 검색했음을 시사한다.
  • 정확한 복사가 없는 경우에도 모델이 새로운 구조로 일반화되는 것을 확인했으며, 이는 리트리버가 단순 암기 외에도 의미 있는 인라인 학습을 지원함을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.