Skip to main content
QUICK REVIEW

[논문 리뷰] In-context Example Selection with Influences

Tai D. Nguyen, Eric Wong|arXiv (Cornell University)|2023. 02. 21.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 소수 샘플 언어 모델 성능에 대해 개별 인코어트 예시의 영향을 측정하는 방법인 인코어트 영향(in-context influences)을 소개한다. 재학습 기반의 영향 추정을 통해 순방향 전파를 활용함으로써, 높은 영향력(긍정적)과 낮은 영향력(부정적) 예시를 식별하는 방법으로, 상위 영향력 예시를 하위 영향력 예시보다 선택할 경우 최대 16.3% 향상된 성능을 보이며 9개의 SuperGLUE 과제에서 기존 기준보다 뛰어난 성능을 보였다.

ABSTRACT

In-context learning (ICL) is a powerful paradigm emerged from large language models (LLMs). Despite its promises, ICL performance is known to be highly sensitive to input examples. In this work, we use $ extit{in-context influences}$ to analyze few-shot ICL performance directly from the in-context examples. Our proposed influence-based example selection method can identify both positive and negative examples, outperforming several baselines when evaluated on 9 SuperGLUE tasks. Our analysis uncovers up to a $16.3\%$ performance gap between using the most negative in-context examples compared to the most positive. In a case study, we apply our influence-based framework to quantify the phenomena of recency bias in example ordering for few-shot ICL.

연구 동기 및 목표

  • 개별 인코어트 예시가 소수 샘플 인코어트 학습(ICL) 성능에 미치는 영향을 이해하고 측정하는 것.
  • 모델 예측에 대한 그들의 영향을 기반으로 최적의 인코어트 예시를 선택하기 위한 확장 가능하고 오프라인인 방법 개발.
  • 특히 최근성 및 다수 편향과 같은 알려진 편향이 존재할 때 예시 선택 및 순서에 의한 ICL 성능의 변동성 분석.
  • 분류 외의 다른 NLP 과제와 모델 패밀리로까지 영향 프레임워크를 일반화하는 것.

제안 방법

  • 재학습 기반의 영향 프레임워크를 ICL에 적응시켜, '학습'을 인코어트 예시의 부분 집합을 사용한 프롬프트에 대한 순방향 전파로 시뮬레이션한다.
  • 다양한 예시 부분 집합을 포함한 k-샷 프롬프트 데이터셋을 구성하고, 검증 성능을 측정하여 영향을 추정한다.
  • 검증 세트의 예시를 활용해 부분 성능에서 개별 예시 기여도로의 선형 매핑을 학습하여 영향 점수를 계산한다.
  • 이 프레임워크는 어떤 성능 지표에도 일반화 가능하며, 예시 순서 분석을 통해 최근성 편향과 같은 위치 효과를 분석할 수 있다.
  • 모델의 쿼리 액세스를 활용하여 기울기 계산을 회피함으로써, 표준 영향 방법에 비해 계산적으로 효율적이다.
Figure 1: Test accuracy increases when examples are selected in increasing in-context influence percentile bins.
Figure 1: Test accuracy increases when examples are selected in increasing in-context influence percentile bins.

실험 결과

연구 질문

  • RQ1개별 인코어트 예시가 소수 샘플 ICL 성능에 어떤 영향을 미치며, 그 영향의 긍정적 또는 부정적 영향을 정량화할 수 있는가?
  • RQ2영향 기반 예시 선택이 기존 기준(예: 의미 유사도 또는 퍼플렉서티)보다 효과적인 인코어트 예시 선택에 뛰어나게 할 수 있는가?
  • RQ3ICL에서 가장 영향력이 큰 예시와 가장 영향력이 작은 예시 사이의 성능 차이는 어느 정도인가?
  • RQ4예시 순서가 ICL 성능에 어떤 영향을 미치며, 영향 분석을 통해 최근성 편향을 정량화할 수 있는가?
  • RQ5인코어트 영향이 예측 퍼플렉서티나 임베딩 유사도와 같은 알려진 신호와 어느 정도 상관이 있는가?

주요 결과

  • 영향 기반 예시 선택은 9개의 SuperGLUE 과제에서 다수의 기준보다 긍정적 및 부정적 예시 선택 모두에서 뛰어난 성능을 보였다.
  • LLaMA-13B에서 가장 긍정적과 가장 부정적인 인코어트 예시 간 성능 격차는 최대 16.3%에 이르며, 예시 영향력의 상당한 변동성을 보여준다.
  • 프레임워크는 최근성 편향을 성공적으로 정량화했으며, 특히 긴 k-샷 설정에서 후행 위치에 있는 예시가 더 높은 영향력을 가짐을 보였다.
  • 영향 점수는 예측 퍼플렉서티나 임베딩 유사도와 같은 기존 신호와 거의 상관이 없으며, 독립적이고 정보가 풍부한 신호를 포착하고 있음을 시사한다.
  • 이 방법은 다중 선택 및 이진 분류 과제를 포함한 다양한 모델 패밀리와 과제로 일반화되며, 특히 다중 선택 과제에서 더 강한 성과 향상을 보였다.
Figure 2: Token budget comparison for different baselines evaluated on LLaMA-7B ( $|S|=400$ ).
Figure 2: Token budget comparison for different baselines evaluated on LLaMA-7B ( $|S|=400$ ).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.