Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Prompting Large Language Models for Zero-Shot Open-Domain QA

Junlong Li, Wang, Jinyuan|arXiv (Cornell University)|2022. 12. 16.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용하여 zero-shot 오픈도메인 질의응답에서의 맥락 학습을 위한 고품질 가짜 QA 데이터셋을 자동으로 생성하는 Self-Prompting 프레임워크를 제안한다. 이는 문장과 설명을 포함한 가짜 QA 쌍을 반복적으로 생성하고, 군집 기반 검색 방법을 통해 다양하고 핵심적인 예시를 선별함으로써 WebQ, NQ, TriviaQA에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 훈련 데이터 없이도, 외부 코퍼스 없이도, 미세조정된 Retriever-Reader 모델에 맞먹는 성능을 내며, 훈련 데이터가 전혀 필요하지 않다.

ABSTRACT

Open-Domain Question Answering (ODQA) aims to answer questions without explicitly providing specific background documents. This task becomes notably challenging in a zero-shot setting where no data is available to train tailored retrieval-reader models. While recent Large Language Models (LLMs) like GPT-3 have demonstrated their effectiveness in zero-shot ODQA using direct prompting methods, these methods still fall short of fully harnessing the potential of LLMs when implicitly invoked. In this paper, we propose a Self-Prompting framework to explicitly utilize the massive knowledge encoded in the parameters of LLMs and their strong instruction understanding abilities. Concretely, we prompt LLMs step by step to generate multiple pseudo QA pairs with background passages and explanations entirely from scratch. These generated elements are then utilized for in-context learning. Experimental results show that our method significantly surpasses previous state-of-the-art zero-shot methods on three widely-used ODQA datasets and even achieves comparable performance with various customized fine-tuned models on full training data. Our code is available at https://github.com/lockon-n/self-prompting.

연구 동기 및 목표

  • 훈련 데이터나 외부 지식 코퍼스가 없는 zero-shot 오픈도메인 질의응답(ODQA) 문제에 대응하기 위해.
  • 단순한 직접 프롬프팅을 넘어서 LLM의 지식과 지시 준수 능력을 명시적으로 활용하기 위해.
  • 맥락 학습을 위한 문장과 설명이 포함된 가짜 QA 데이터셋을 생성함으로써 zero-shot ODQA 성능을 향상시키기 위해.
  • 추론를 위한 고품질이고 다양한 예시를 생성된 가짜 데이터셋에서 효과적으로 선별하는 방법을 개발하기 위해.
  • LLM이 생성한 데이터가 맥락 학습에서 수동으로 애너테이션된 훈련 데이터의 성능을 따라할 수 있는지 평가하기 위해.

제안 방법

  • 이 방법은 준비 단계와 추론 단계의 두 단계로 구성된다.
  • 준비 단계에서는 LLM이 단계별로 위키피디아 스타일의 문장을 생성하고, 명시적 개체를 답변으로 추출하며, 질문을 구성하고, 각 QA 쌍에 대해 간결한 설명을 작성하도록 프롬프팅된다.
  • 생성된 가짜 데이터셋은 관련된 문장과 설명이 포함된 구조화된 QA 쌍을 포함하며, 고품질의 합성 훈련 세트를 형성한다.
  • 추론 단계에서는 군집 기반 검색 방법을 사용해 각 테스트 질문에 대해 의미적으로 유사하고 다양한 예시를 가짜 데이터셋에서 선별한다.
  • 선택된 QA 쌍과 함께 그들의 문장과 설명이 특정 형식(예: QAE: 질문, 답변, 설명)으로 테스트 질문과 결합되어 LLM의 최종 입력이 된다.
  • 최종 답변은 맥락 기반의 예시들을 바탕으로 LLM이 생성하며, 이는 미세조정 없이 zero-shot 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1LLM은 zero-shot ODQA를 위해 지원 문장과 설명이 포함된 고품질이고 사실적으로 일관된 QA 삼중항을 자동으로 생성할 수 있는가?
  • RQ2자기 생성된 가짜 데이터셋을 맥락 학습에 사용할 경우, 직접 프롬프팅이나 이전의 최신 기술 수준(SOTA) zero-shot 방법보다 성능이 뛰어나게 되는가?
  • RQ3군집 기반 검색 전략은 생성된 가짜 데이터셋에서 다양하고 관련성이 높은 예시를 선별하는 데 얼마나 효과적인가?
  • RQ4LLM이 생성한 데이터의 성능이 맥락 학습에서 수동 애너테이션된 훈련 데이터의 성능과 맞먹는가?
  • RQ5다양한 프롬프트 형식(예: QA 대비 QAE)은 최종 답변 정확도에 어떤 영향을 미치는가?

주요 결과

  • Self-Prompting은 GENREAD를 포함한 이전의 최신 기술 수준(SOTA) zero-shot ODQA 방법보다 WebQ, NQ, TriviaQA 벤치마크에서 뚜렷이 뛰어난 성능을 보였다.
  • 이 방법은 훈련 데이터 없이도 전체 훈련 데이터로 훈련된 미세조정된 Retriever-Reader 모델과 유사한 성능을 달성했다.
  • 유사한 수의 예시를 사용할 경우, 수동 애너테이션된 훈련 데이터를 사용한 성능과 1 EM/F1 포인트 이내로 수렴하여 높은 품질의 데이터 생성 능력을 입증했다.
  • QAE 형식(Question, Answer, Explanation)은 QA 형식보다 일관되게 성능을 향상시키며, 특히 예시 수가 적을 경우 두드러진다.
  • InstructGPT와 Codex는 Alpaca나 GPT-NeoX와 같은 더 작은 모델보다 더 낮은 사실 오류를 유발하며 더 높은 품질의 데이터를 생성함으로써, 모델 규모와 지시 준수 능력의 영향을 입증했다.
  • 군집 기반 검색 방법은 다양하고 의미적으로 관련성이 높은 예시를 효과적으로 선별하여, 테스트 샘플 전반에 걸쳐 일반화 능력과 견고성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.