[논문 리뷰] Query Refinement Prompts for Closed-Book Long-Form Question Answering
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 사용한 소수의 예시를 활용한 닫혀 있는 책 모드(long-form question answering)에서 질의 개선 프롬프트를 도입하여 성능을 향상시킨다. 모델이 모호하거나 다면적인 질문의 여러 측면(예: 다른 해석 방식 또는 다중 출처 정보)을 명시적으로 식별하도록 프롬프트를 제공함으로써, LLMs는 더 포괄적이고 일관성 있는 답변을 생성한다. 이 방법은 오픈북 모드의 검색-다음에 생성하는 모델과 유사한 성능을 달성하며, ASQA 및 AQuAMuSe 데이터셋에서 완전히 미세조정된 닫혀 있는 책 모드 모델을 뛰어넘는다.
Large language models (LLMs) have been shown to perform well in answering questions and in producing long-form texts, both in few-shot closed-book settings. While the former can be validated using well-known evaluation metrics, the latter is difficult to evaluate. We resolve the difficulties to evaluate long-form output by doing both tasks at once -- to do question answering that requires long-form answers. Such questions tend to be multifaceted, i.e., they may have ambiguities and/or require information from multiple sources. To this end, we define query refinement prompts that encourage LLMs to explicitly express the multifacetedness in questions and generate long-form answers covering multiple facets of the question. Our experiments on two long-form question answering datasets, ASQA and AQuAMuSe, show that using our prompts allows us to outperform fully finetuned models in the closed book setting, as well as achieve results comparable to retrieve-then-generate open-book models.
연구 동기 및 목표
- 장문의 텍스트 생성 평가에 도전하는 닫혀 있는 책 모드 질의 응답에서, 출력 결과가 주관적이고 검증하기 어려운 문제를 해결하기 위해.
- 모호성이나 다중 출처 정보를 포함하는 다면적인 질문을 명시적으로 모델링하여 장문의 답변의 품질과 완전성을 향상시키기 위해.
- 복잡한 질문을 이해 가능한 다수의 측면으로 분해하기 전에 답변을 생성하도록 유도하는 프롬프팅 전략을 개발하기 위해.
- 소수의 예시를 활용한 프롬프팅과 질의 개선을 통해 완전히 미세조정된 닫혀 있는 책 모드 모델을 뛰어넘고, 오픈북 모드의 검색-다음에 생성 시스템과 성능이 유사한 결과를 도출할 수 있음을 입증하기 위해.
제안 방법
- 질의의 여러 측면(예: 다른 해석 방식 또는 출처에 의존하는 정보 등)을 식별하고 명시적으로 기록하도록 LLMs를 유도하는 질의 개선 프롬프트를 설계한다.
- 다면성의 유형(예: 모호성, 다중 출처 정보 등)으로 분류하고 다양한 질문 유형을 커버하는 라벨이 부여된 개선 프롬프트 세트를 제작한다.
- 답변 생성 이전에 중간 단계로 질의 개선을 도입하여, 유사한 추론 체인과 유사하게 여러 가지 해석이나 정보 출처를 명확히 드러낸다.
- PaLM 540B 및 T5 모델에서 소수의 예시 프롬프팅과 프롬프트 튜닝을 활용하여 이 개선 프롬프트를 적용하고 장문의 답변을 생성한다.
- 유창성 평가에는 ROUGE를, 정확성 평가에는 QAEval_rheme를 사용하며, 모델 출력에서 생성된 질문을 평가하여 답변 가능성을 측정한다.
- 프롬프트 튜닝 중에 ASQA 및 AQuAMuSe 데이터셋에서 동적으로 예시를 선택하여 질문 유형 간 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1질의 개선 프롬프트는 닫혀 있는 책 모드 LLM의 질의 응답에서 장문의 답변 품질과 완전성을 향상시킬 수 있는가?
- RQ2다면적인 질문 분해를 위한 프롬프팅은 표준 소수의 예시 프롬프팅 또는 프롬프트 튜닝 대비 성능에 어떤 영향을 미치는가?
- RQ3질의 개선 프롬프트를 활용한 소수의 예시 프롬프팅이 완전히 미세조정된 닫혀 있는 책 모델을 능가할 수 있는가?
- RQ4닫혀 있는 책 모드에서 질의 개선을 통한 프롬프팅이 오픈북 모드의 검색-다음에 생성 시스템과 유사한 성능을 달성할 수 있는가?
- RQ5동적으로 프롬프트 선택 중에 ASQA 및 AQuAMuSe 등 여러 데이터셋의 예시를 통합함으로써 모델의 일반화 능력과 성능이 향상되는가?
주요 결과
- AQuAMuSe에서 AF(Answer-Faceted) 개선 프롬프트를 소수의 예시 프롬프팅에 적용한 결과, ROUGE-L 점수는 32.94로 상승하고 QAEval_rheme 점수는 12.50으로 상승하여 무작위 기준선(ROUGE-L 28.12, QAEval_rheme 10.26)을 크게 뛰어넘었다.
- 동적 프롬프트 선택 중 ASQA 예시를 포함시킨 결과, AQuAMuSe에서 ROUGE-L 점수는 33.73으로 상승하고 QAEval_rheme 점수는 13.24로 상승하여 데이터셋 간 일반화 능력 향상이 확인되었다.
- 질의 개선 프롬프트를 활용한 소수의 예시 프롬프팅은 완전히 미세조정된 T5-XL 닫혀 있는 책 모델(ROUGE-L 26.17, QAEval_rheme 5.62)을 뛰어넘었다.
- 질의 개선과 ASQA 예시를 활용한 프롬프트 튜닝은 ROUGE-L 33.30, QAEval_rheme 11.77 점수를 기록하여 기본 프롬프트 튜닝보다 우수했지만, 오픈북 모델에 비해 여전히 뒤처졌다.
- ASQA에서 이 방법은 완전히 미세조정된 닫혀 있는 책 모델을 능가했고, ROUGE 및 QAEval 측면에서 오픈북 시스템과 유사한 성능을 달성했지만, 오픈북 모델가 여전히 절대 성능에서 앞섰다.
- 오픈북 LongT5-XL 모델은 ROUGE-L 61.43, QAEval_rheme 39.22 점을 기록하여 모든 닫혀 있는 책 모델보다 유의미하게 뛰어나며, 검색 기반 접근의 우수성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.