Skip to main content
QUICK REVIEW

[논문 리뷰] Dr.ICL: Demonstration-Retrieved In-context Learning

Man Luo, Xin Xu|arXiv (Cornell University)|2023. 05. 23.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 오프더섀프 리트리버(BM25, GTR) 또는 작업별 전용 디모나스트레이션 리트리버를 사용하여 의미적으로 유사한 디모나스트레이션을 검색함으로써 LLM 성능을 햖थन하는 Dr.ICL라는 디모나스트레이션 검색 기반의 인라인 컨텍스트 러닝 프레임워크를 소개한다. 검색 기반 ICL이 랜덤 디모나스트레이션보다 성능이 뛰어나며, 특히 원샷 설정에서 두드러지게 향상되며, 지시어 편집된 모델과 체인 오브 토우 촉진 기법에서도 성능 향상을 이룬다.

ABSTRACT

In-context learning (ICL), teaching a large language model (LLM) to perform a task with few-shot demonstrations rather than adjusting the model parameters, has emerged as a strong paradigm for using LLMs. While early studies primarily used a fixed or random set of demonstrations for all test queries, recent research suggests that retrieving semantically similar demonstrations to the input from a pool of available demonstrations results in better performance. This work expands the applicability of retrieval-based ICL approaches by demonstrating that even simple word-overlap similarity measures such as BM25 outperform randomly selected demonstrations. Furthermore, we extend the success of retrieval-based ICL to instruction-finetuned LLMs as well as Chain-of-Thought (CoT) prompting. For instruction-finetuned LLMs, we find that although a model has already seen the training data at training time, retrieving demonstrations from the training data at test time yields better results compared to using no demonstrations or random demonstrations. Last but not least, we train a task-specific demonstration retriever that outperforms off-the-shelf retrievers.

연구 동기 및 목표

  • 디모나스트레이션 풀에서 의미적으로 유사한 것을 검색하여 랜덤 또는 고정된 디모나스트레이션을 대체함으로써 인라인 컨텍스트 러닝(ICL) 성능을 향상시키는 것.
  • 훈련 데이터를 추론 시점에 재사용할 수 있는지, 특히 지시어 편집된 LLM의 경우에도 성능 향상이 이루어지는지 조사하는 것.
  • Dr.ICL와 체인 오브 토우(Chain-of-Thought, CoT)와 같은 고급 촉진 기법 간의 상호작용을 평가하는 것.
  • 오프더섀프 리트리버보다 우수한 성능을 보이는 작업별 전용 디모나스트레이션 리트리버를 개발하고 훈련하는 것.
  • 검색의 성능 향상 원인이 레이블 겹침인지, 진정한 의미적 유사성인지 규명하여 단순한 레이블 식별이 원인임을 배제하는 것.

제안 방법

  • 입력 쿼리와 의미적으로 유사한 디모나스트레이션을 검색하기 위해 오프더섀프 스퍼스(BM25) 및 디스트 리트리버(GTR)를 사용하는 것.
  • 오프더섀프 리트리버로 검색된 후보 디모나스트레이션을 재순서 정렬하기 위해 언어 모델을 사용하여 디모나스트레이션 검색 훈련 데이터셋을 구성하는 것.
  • 상위 및 하위 순위의 후보 디모나스트레이션에서 양성 및 하드 음성 예제를 구성하여 작업별 전용 디모나스트레이션 리트리버를 훈련하는 것.
  • 훈련된 리트리버를 활용해 추론 시 최적의 디모나스트레이션을 선택하고, 이를 인라인 컨텍스트 러닝의 프롬프트에 통합하는 것.
  • Dr.ICL를 체인 오브 토우(CoT) 촉진 기법과 결합하여 추론 과제에서의 성능 향상을 평가하는 것.
  • 소수의 샘플 설정에서는 다수결 투표를 사용하고, 정답과의 답변 겹침을 분석하여 레이블 편향이 성능 향상의 원인임을 배제하는 것.
Figure 1: The average performance of PaLM and Flan-PaLM on five datasets, with one and few-shot ICL. Retrieved demonstrations given by either BM25 or GTR yield better performance than random demonstrations.
Figure 1: The average performance of PaLM and Flan-PaLM on five datasets, with one and few-shot ICL. Retrieved demonstrations given by either BM25 or GTR yield better performance than random demonstrations.

실험 결과

연구 질문

  • RQ1오프더섀프 리트리버(BM25, GTR)를 사용한 검색 기반 ICL이 인라인 컨텍스트 러닝에서 랜덤 또는 고정된 디모나스트레이션보다 성능이 뛰어나게 되는가?
  • RQ2훈련 데이터에서 디모나스트레이션을 추론 시점에 검색하면, 이미 훈련 중에 데이터를 봤던 지시어 편집된 LLM의 성능 향상에 기여하는가?
  • RQ3Dr.ICL는 체인 오브 토우(CoT)와 같은 고급 촉진 기법의 성능 향상에 기여하는가?
  • RQ4모델이 생성한 재순서 정렬 신호를 기반으로 훈련된 작업별 전용 디모나스트레이션 리트리버는 오프더섀프 리트리버를 능가하는가?
  • RQ5검색의 성능 향상 원인이 레이블 겹침인지, 질문과 디모나스트레이션 간 진정한 의미적 유사성인지인가?

주요 결과

  • 오프더섀프 리트리버(BM25 및 GTR)는 원샷 및 소수 샘플 ICL 모두에서 랜덤 디모나스트레이션보다 일관되게 뛰어난 성능을 보이며, GTR는 보통 BM25보다 더 대표적인 예제를 검색한다.
  • Flan-PaLM과 같은 지시어 편집된 LLM의 경우, 훈련 시점에 데이터를 이미 봤음에도 불구하고 추론 시 훈련 데이터의 디모나스트레이션을 검색하면, 아무런 디모나스트레이션을 사용하지 않거나 랜덤 디모나스트레이션을 사용하는 것보다 성능이 뛰어나다.
  • Dr.ICL를 체인 오브 토우(CoT) 촉진 기법과 결합하면, GSM8k, StrategyQA, AQuA에서 원샷 및 소수 샘플 설정 모두에서 성능 향상이 이루어지며, 고급 촉진 기법과의 상호작용이 있음을 시사한다.
  • 재순서 정렬된 후보를 기반으로 훈련된 작업별 전용 디모나스트레이션 리트리버는 오프더섀프 리트리버를 능가하며, 원샷 ICL에서 NQ에서는 1.4점의 절대적 향상, GSM8k에서는 1.6점의 향상이 이루어졌다.
  • 검색의 성능 향상 원인이 레이블 겹침이 아니며, 대부분의 데이터셋에서 낮은 답변 겹침 비율을 통해 이를 입증하여 진정한 의미적 유사성이 성능 향상의 원인임을 시사한다.
  • 훈련된 리트리버에서 가장 두드러진 성능 향상은 원샷 ICL에서 발생하며, 이는 저지연 및 낮은 메모리 사용이 중요한 실세계 구현에 매우 적합하다.
Figure 2: Pipeline for training demonstration retriever and inference (R for a neural retriever). Figure on the left shows the procedure of obtaining data to train a demonstration retriever: an off-the-shelf retriever takes an input query $x_{q}$ and retrieves top- $k$ (e.g., 100) demonstrations can
Figure 2: Pipeline for training demonstration retriever and inference (R for a neural retriever). Figure on the left shows the procedure of obtaining data to train a demonstration retriever: an off-the-shelf retriever takes an input query $x_{q}$ and retrieves top- $k$ (e.g., 100) demonstrations can

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.