Skip to main content
QUICK REVIEW

[논문 리뷰] Demystifying Prompts in Language Models via Perplexity Estimation

Hila Gonen, Srini Iyer|arXiv (Cornell University)|2022. 12. 08.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 모델의 익숙함을 측정하는 지표로 퍼플렉서티를 사용하여 퍼플렉서티가 가장 낮은 프롬프트를 선택하는 SPELL(Selecting Prompts by Estimating LM Likelihood)을 제안한다. 자동 문장 다듬기와 퍼플렉서티 추정을 통해 레이블이 필요 없이도 수동 프롬프트보다 평균 정확도를 1.8~3.6점 향상시킨다. 이는 다양한 작업과 모델에서 낮은 퍼플렉서티를 가진 프롬프트가 성능 향상과 강한 상관관계를 보임을 시사한다.

ABSTRACT

Language models can be prompted to perform a wide variety of zero- and few-shot learning problems. However, performance varies significantly with the choice of prompt, and we do not yet understand why this happens or how to pick the best prompts. In this work, we analyze the factors that contribute to this variance and establish a new empirical hypothesis: the performance of a prompt is coupled with the extent to which the model is familiar with the language it contains. Over a wide range of tasks, we show that the lower the perplexity of the prompt is, the better the prompt is able to perform the task. As a result, we devise a method for creating prompts: (1) automatically extend a small seed set of manually written prompts by paraphrasing using GPT3 and backtranslation and (2) choose the lowest perplexity prompts to get significant gains in performance.

연구 동기 및 목표

  • 제로-샷 및 소수의 프롬프트 성능이 유사한 표면 형태를 가졌음에도 불구하고 일부 프롬프트가 더 잘 작동하는 이유를 이해하기 위해.
  • 모델이 프롬프트에 얼마나 익숙한지를 퍼플렉서티로 측정한 결과, 이와 같은 모델의 익숙함이 최종 작업 성능과 상관관계가 있는지 조사하기 위해.
  • 태스크 전용 레이블이 필요 없고 모델에 종속되지 않는 고성능 프롬프트를 생성하기 위한 방법 개발을 위해.
  • 낮은 퍼플렉서티를 가진 프롬프트가 다양한 작업과 모델 아키텍처에서 안정적이고 높은 정확도를 보이는지 검증하기 위해.

제안 방법

  • GPT-3를 사용해 소수의 수동으로 작성된 시드 프롬프트를 자동으로 다듬고, 역번역을 통해 다양한 후보 프롬프트의 대량 풀을 생성한다.
  • 대상 언어 모델을 사용해 각 후보 프롬프트의 퍼플렉서티를 추정하여 모델이 프롬프트에 얼마나 익숙한지를 측정한다.
  • 가장 낮은 퍼플렉서티를 가진 k개의 프롬프트를 추출해 추론용 최종 프롬프트 세트로 선정한다.
  • 선택된 낮은 퍼플렉서티 프롬프트를 사용해 태스크 전용 레이블 없이도 최종 작업에서 소수의 프롬프트를 수행한다.
  • 다양한 작업과 모델들(OPT-175B, Bloom 등)에서 성능을 평가하여 방법의 일반화 능력과 강건성을 검증한다.
  • 낮은 퍼플렉서티 프롬프트의 성능을 수동으로 구성한 프롬프트와 비교해 성과 향상과 안정성을 정량화한다.
Figure 1: Accuracy vs. perplexity for the AG News dataset with OPT 175b. The $x$ axis is in log scale. Each point stands for a different prompt.
Figure 1: Accuracy vs. perplexity for the AG News dataset with OPT 175b. The $x$ axis is in log scale. Each point stands for a different prompt.

실험 결과

연구 질문

  • RQ1프롬프트의 퍼플렉서티가 최종 작업 성능과 상관관계가 있는가?
  • RQ2사전 학습 데이터에 접근할 수 없더라도 퍼플렉서티가 모델이 프롬프트에 익숙한 정도를 신뢰할 수 있는 지표로 기능할 수 있는가?
  • RQ3낮은 퍼플렉서티를 기반으로 프롬프트를 선택할 경우, 다양한 작업과 모델 아키텍처에서 일관된 성능 향상이 이루어지는가?
  • RQ4낮은 퍼플렉서티 프롬프트의 성능는 정확도와 분산 측면에서 수동으로 설계된 프롬프트와 비교해 어떻게 되는가?

주요 결과

  • 프롬프트의 퍼플렉서티와 작업 성능 사이에 강한 음의 상관관계가 존재하며, 낮은 퍼플렉서티가 다양한 작업과 모델에서 높은 정확도를 지속적으로 예측한다.
  • 확장된 프롬프트 풀에서 퍼플렉서티가 가장 낮은 3개의 프롬프트를 사용할 경우, OPT-175B에서는 수동 프롬프트 대비 평균 정확도가 1.8점 향상되었고, Bloom에서는 3.6점 향상되었다.
  • 낮은 퍼플렉서티 프롬프트의 성능는 수동으로 만든 프롬프트보다 훨씬 안정적이었으며, 표준편차도 낮았다(OPT-175B: 5.07 vs. 6.86, Bloom: 1.31 vs. 5.15).
  • 레이블이 전혀 필요 없는 SPELL 방법은 비전문가 사용자에게도 실용적인 성능 향상을 제공한다.
  • 최적의 프롬프트 세트는 모델에 따라 달라지며, 이는 프롬프트 성능이 모델에 따라 특화되어 있으며 아키텍처 간으로 일반화될 수 없다는 것을 시사한다.
(a)
(a)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.