Skip to main content
QUICK REVIEW

[논문 리뷰] SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs

Jaehyung Kim, Jaehyun Nam|arXiv (Cornell University)|2024. 04. 17.
Natural Language Processing Techniques인용 수 4
한 줄 요약

SuRe는 검색된 문단의 후보자에 따라 조정된 요약을 생성하여 개방형 질의응답(ODQA)의 정답 기반성과 정확도를 향상시키는 제로샷 프ompting 프레임워크를 제안한다. 요약의 타당성과 상대적 정보량을 평가함으로써, 표준 프롬프팅 대비 F1 점수를 최대 4.0% 향상시키고 정확히 일치하는 정답 수를 최대 4.6% 향상시키며, 다양한 LLM과 검색 방법에 대해 뛰어난 일반화 성능을 보인다.

ABSTRACT

Large language models (LLMs) have made significant advancements in various natural language processing tasks, including question answering (QA) tasks. While incorporating new information with the retrieval of relevant passages is a promising way to improve QA with LLMs, the existing methods often require additional fine-tuning which becomes infeasible with recent LLMs. Augmenting retrieved passages via prompting has the potential to address this limitation, but this direction has been limitedly explored. To this end, we design a simple yet effective framework to enhance open-domain QA (ODQA) with LLMs, based on the summarized retrieval (SuRe). SuRe helps LLMs predict more accurate answers for a given question, which are well-supported by the summarized retrieval that could be viewed as an explicit rationale extracted from the retrieved passages. Specifically, SuRe first constructs summaries of the retrieved passages for each of the multiple answer candidates. Then, SuRe confirms the most plausible answer from the candidate set by evaluating the validity and ranking of the generated summaries. Experimental results on diverse ODQA benchmarks demonstrate the superiority of SuRe, with improvements of up to 4.6% in exact match (EM) and 4.0% in F1 score over standard prompting approaches. SuRe also can be integrated with a broad range of retrieval methods and LLMs. Finally, the generated summaries from SuRe show additional advantages to measure the importance of retrieved passages and serve as more preferred rationales by models and humans.

연구 동기 및 목표

  • 표준 프롬프팅이 장문의 맥락을 효과적으로 활용하지 못하고 관련 정보를 검색하지 못하는 검색 보강형 LLM의 한계를 해결하기 위해.
  • 정답 후보자에 따라 조정된 이행 유사 요약을 생성하여 개방형 QA에서 정답 기반성 향상과 환각 현상 감소를 위해.
  • 피드백 조정 없이도 작동하는 제로샷, 즉시 통합 가능한 프레임워크를 개발하여 블랙박스 LLM API와 다양한 검색 방법에 적합하도록 하기 위해.
  • 생성된 요약이 모델과 인간의 이해를 위한 더 나은 이행 과정으로 기능하는지 평가하기 위해.

제안 방법

  • SuRe는 각기 다른 정답 후보자에 따라 조정된 여러 요약을 검색된 문단에서 생성하여 관련 맥락에 집중한다.
  • 대규모 언어 모델을 사용하여 각 후보자-요약 쌍의 타당성을 평가하여 요약이 후보자를 지지하는지 확인한다.
  • LLM를 이용한 쌍대 비교를 통해 질문에 답하는 데 있어 각 요약의 정보량을 기준으로 순위를 매긴다.
  • 최종 정답은 가장 높은 순위이자 가장 타당성이 높은 요약에 기반하여 선택되며, 이는 예측의 이행 과정이 된다.
  • 모든 단계는 피드백 조정 없이 제로샷 프롬프팅을 통해 수행되며, 소수의 예시도 필요로 하지 않는다.
  • 이 방법은 다양한 검색 방법(BM25, DPR, Contriever)과 LLM(GPT-4, ChatGPT, LLaMA-2)과 호환된다.

실험 결과

연구 질문

  • RQ1후보자에 따라 조정된 요약은 제로샷 개방형 질의응답에서 LLM의 정확도를 향상시킬 수 있는가?
  • RQ2제로샷 프롬프팅을 통해 생성된 요약은 일반적인 요약보다 더 신뢰할 수 있고 해석 가능한 이행 과정으로 기능할 수 있는가?
  • RQ3피드백 조정 없이 다양한 검색 방법과 LLM에서 SuRe의 성능은 어떠한가?
  • RQ4생성된 요약을 사용하여 검색된 문단의 중요도를 측정할 수 있는가?
  • RQ5SuRe는 QA 시스템에서 모델과 인간의 이행 과정 선호도를 향상시키는가?

주요 결과

  • SuRe는 네 개의 ODQA 벤치마크에서 표준 프롬프팅 대비 정확히 일치(EM) 점수를 최대 4.6% 향상시키고 F1 점수를 최대 4.0% 향상시켰다.
  • ChatGPT와 BM25를 사용할 경우, 검색 보강 없이 대비해 SuRe는 제로샷 QA 정확도를 12.8% 향상시켰다.
  • GPT-4, LLaMA-2, ChatGPT 등의 다양한 LLM과 BM25, DPR, Contriever 등의 다양한 검색 방법에서 잘 일반화된다.
  • SuRe에서 생성된 요약은 일반적인 요약보다 정보량이 많고, 모델과 인간 모두에서 더 선호된다.
  • 요약은 검색된 문단 중 가장 관련성이 높은 것을 효과적으로 식별하고 순위를 매겨 해석 가능성과 중요도 평가를 가능하게 한다.
  • 모든 데이터셋에서 체인 오브 톰, 세프-베리피케이션, RePlug과 같은 강력한 베이스라인을 능가하며, EM과 F1에서 일관된 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.