Skip to main content
QUICK REVIEW

[논문 리뷰] An Information-theoretic Approach to Prompt Engineering Without Ground Truth Labels

Taylor Sorensen, Joshua A. Robinson|arXiv (Cornell University)|2022. 03. 21.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 입력과 모델 출력 간 상호정보량(MI)을 최대화함으로써 최적의 프롬프트 템플릿을 선택하는 새로운 레이블 없는 프롬프트 엔지니어링 방법을 제안한다. 이 방법은 지식 기반 레이블이나 모델 파라미터 접근이 필요 없으며, 8개의 다양한 NLP 작업에서 평균 프롬프트 정확도에서 최고의 프롬프트 정확도까지 90% 수준의 성능을 달성하여, 지식 기반 레이블 없이도 오라클 수준의 성능을 낼 수 있다.

ABSTRACT

Pre-trained language models derive substantial linguistic and factual knowledge from the massive corpora on which they are trained, and prompt engineering seeks to align these models to specific tasks. Unfortunately, existing prompt engineering methods require significant amounts of labeled data, access to model parameters, or both. We introduce a new method for selecting prompt templates extit{without labeled examples} and extit{without direct access to the model}. Specifically, over a set of candidate templates, we choose the template that maximizes the mutual information between the input and the corresponding model output. Across 8 datasets representing 7 distinct NLP tasks, we show that when a template has high mutual information, it also has high accuracy on the task. On the largest model, selecting prompts with our method gets 90\% of the way from the average prompt accuracy to the best prompt accuracy and requires no ground truth labels.

연구 동기 및 목표

  • 레이블 데이터가 부족하거나 이용할 수 없는 저자원 환경에서 프롬프트 엔지니어링의 과제를 해결하기 위해.
  • 효과적인 프롬프트 템플릿을 선택하기 위해 모델 파라미터나 지식 기반 레이블에 의존하지 않도록 하기 위해.
  • 고정된 언어 모델의 입력-출력 통계만을 사용하여 프롬프트 성능을 예측하는 방법을 개발하기 위해.
  • 입력과 모델 출력 간 상호정보량이 최종 작업 정확도의 강력한 대체 지표가 될 수 있음을 입증하기 위해.
  • 기울기 기반 최적화가 불가능한 폐쇄원천 또는 블랙박스 언어 모델에 대해서도 프롬프트 선택을 가능하게 하기 위해.

제안 방법

  • 이 방법은 입력 토큰과 모델 생성 출력 간 상호정보량(MI)을 추정하여 프롬프트 템플릿을 선택한다.
  • 각 후보 템플릿에 대해, 검증용 입력 집합에서 모델이 출력을 생성하고, 입력과 출력 분포 간의 MI를 계산한다.
  • 입력 및 출력 토큰 시퀀스의 결합 분포에 대해 비모수적 k-최근접 이웃 방법을 사용해 MI를 추정한다.
  • 가장 높은 추정 MI를 가진 템플릿이 가장 정보량이 많고, 높은 작업 정확도를 낼 가능성이 높다고 선택된다.
  • 이 접근법은 모델 파라미터에 대한 액세스 없이도 고정된 언어 모델의 출력만을 사용하여 완전히 작동한다.
  • 출력 분산을 줄이기 위해 토큰 집합이 압축되어 MI 추정의 안정성이 향상된다.

실험 결과

연구 질문

  • RQ1입력과 모델 출력 간 상호정보량이 프롬프트 선택에서 최종 작업 정확도의 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ2지식 기반 레이블을 사용하지 않고도 MI 기반 프롬프트 선택이 오라클 프롬프트 선택 성능에 얼마나 가까이 도달할 수 있는가?
  • RQ3레이블이 이용 불가능한 상황에서, MI 기반 방법은 다양한 NLP 작업과 모델 크기에서 어떻게 성능을 내는가?
  • RQ4이 방법은 다양한 프롬프트 템플릿과 입력 분포에 대해 일반화되는가?
  • RQ5모델 파라미터에 접근할 수 없을 때도 MI 추정이 고성능 프롬프트를 식별할 수 있는가?

주요 결과

  • 가장 큰 모델(GPT-3 Davinci, 175B)에서, MI 기반 방법은 지식 기반 레이블을 전혀 사용하지 않고도 평균 프롬프트 정확도에서 최고의 프롬프트 정확도까지 90% 수준의 성능을 달성했다.
  • 이 방법은 8개 데이터셋 중 3개에서 가장 높은 성능을 낸 프롬프트를 선택하여 강력한 예측 능력을 입증했다.
  • 모든 8개의 데이터셋과 7개의 NLP 작업에서 상호정보량과 최종 작업 정확도 사이에 강한 정적 상관관계가 관찰되었다.
  • 이 방법은 무작위 선택 및 평균 템플릿 선택보다 뛰어나며, 레이블이나 모델 가중치에 접근할 수 없음에도 불구하고 일관되게 상위 근처 순위를 기록했다.
  • MI와 정확도 사이의 상관관계는 더 큰 언어 모델에서 가장 강했으며, 최신 기술 모델로의 확장성 잠재력을 보였다.
  • 이 방법은 블랙박스 모델에도 효과적이며, 기울기 계산이나 모델 액세스가 필요 없이 추론 출력만으로도 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.