[논문 리뷰] QAMPARI: An Open-domain Question Answering Benchmark for Questions with Many Answers from Multiple Paragraphs
QAMPARI는 위키데이터와 위키백과 표를 기반으로 반자동으로 생성한 질문에 대해 다수의 위키백과 문단에서 다수의 답변을 필요로 하는 도메인 외 질문에 대한 어려운 벤치마크를 소개한다. 이후 인간 검증을 거친다. 최신 기술 모델들에도 불구하고, 가장 높은 F1 점수는 32.8에 불과하여, 다수의 답변과 다수의 문단을 포함하는 질문에 대한 검색 및 답변 생성 과제에서 여전히 큰 도전 과제가 있음을 시사한다.
Existing benchmarks for open-domain question answering (ODQA) typically focus on questions whose answers can be extracted from a single paragraph. By contrast, many natural questions, such as "What players were drafted by the Brooklyn Nets?" have a list of answers. Answering such questions requires retrieving and reading from many passages, in a large corpus. We introduce QAMPARI, an ODQA benchmark, where question answers are lists of entities, spread across many paragraphs. We created QAMPARI by (a) generating questions with multiple answers from Wikipedia's knowledge graph and tables, (b) automatically pairing answers with supporting evidence in Wikipedia paragraphs, and (c) manually paraphrasing questions and validating each answer. We train ODQA models from the retrieve-and-read family and find that QAMPARI is challenging in terms of both passage retrieval and answer generation, reaching an F1 score of 32.8 at best. Our results highlight the need for developing ODQA models that handle a broad range of question types, including single and multi-answer questions.
연구 동기 및 목표
- 다수의 문단에서 다수의 답변이 필요한 오픈도메인 질문에 대한 질문에 대한 벤치마크 부족 문제를 해결하기 위해.
- 단일 답변, 단일 문단 작업을 넘어서 실제 세계의 복잡성을 반영하는 현실적이고 확장 가능한 다수의 답변을 요구하는 벤치마크를 만들기 위해.
- 구성 질문 및 교차 질문을 포함한 다양한 질문 유형에 대해 오픈도메인 QA 모델의 일반화 능력과 견고성을 평가하기 위해.
- 긴 분산형 답변 집합을 처리할 때 현재의 검색-읽기 파이프라인에서 발생하는 주요 병목 현상을 규명하기 위해.
- 모델의 일반화 능력을 향상시키기 위해 단일 답변(NQ 등)과 다수의 답변(QAMPARI 등) 벤치마크를 함께 평가할 것을 촉구하기 위해.
제안 방법
- 위키데이터의 관계와 위키백과 표를 사용하여 정의된 템플릿(예: '[관계]가 [엔티티]와 있는 것은 무엇인가?')을 통해 다수의 답변을 요구하는 질문을 생성한다.
- 엔티티 연결 및 문단 검색을 사용하여 각 답변에 대한 지원 증거 문단을 자동으로 매칭한다.
- 크라우드소싱을 통해 질문을 자연어로 재구성하고 답변의 정확성을 검증하여 언어적 다양성과 사실 정확성을 확보한다.
- 복합성과 교차 질문(예: '클린트 이스트우드가 제작하고 감독한 영화는 무엇인가?')을 구성하여 복잡성을 높인다.
- 이중 단계 평가 설정을 적용한다: 첫 번째로 BM25와 DPR을 사용하여 검색 성능을 평가하고, 두 번째로 RAG 유사 및 FiD 리더를 사용하여 답변 생성 성능을 평가한다.
- 골드 증거 문단을 리더에 제공하여 검색 성능와 독해 성능를 분리하는 오라클 분석을 수행한다.
실험 결과
연구 질문
- RQ1다수의 답변이 여러 문단에 산재해 있는 질문에 대해 현재의 검색-읽기 오픈도메인 QA 모델은 어떤 성능을 보이는가?
- RQ2답변이 50개 이상의 문단에 산재해 있을 경우 모델 성능이 얼마나 떨어지며, 이는 단일 답변 벤치마크와 비교해 어떻게 다를까?
- RQ3다수의 답변 오픈도메인 QA에서 검색 품질과 답변 생성 능력의 상대적 기여도는 어떠한가?
- RQ4NQ와 QAMPARI 양쪽에서 다중 작업 학습을 수행하면 QAMPARI 전용 학습 대비 다수의 답변 질문에서 성능 향상이 이루어지는가?
- RQ5이러한 다수의 답변, 다수의 문단 벤치마크에서 폐쇄책 모델의 성능은 검색-읽기 모델과 비교해 어떻게 되는가?
주요 결과
- QAMPARI에서 가장 뛰어난 성능을 보인 모델의 F1 점수는 단지 32.8에 불과하여, 다수의 답변을 포함하는 질문에 대해 검색 및 답변 생성 과정에서 여전히 큰 과제가 있음을 시사한다.
- 테스트 예제의 31.2%만이 80% 이상의 정답을 확보하고 있어, 분산된 문단들 사이에서 모든 관련 답변을 포괄하는 데의 어려움을 보여준다.
- PIG-DPR는 FiD-DPR보다 리콜 성능이 높아 FiD-BM25보다도 높으며, 이는 다수의 답변 질문에 대해 독립적인 문단 처리가 검색 커버리지 향상에 기여함을 시사한다.
- 오라클 분석 결과, 골드 증거 문단을 제공할 경우 성능이 크게 향상되어, 검색이 주요 병목임을 확인한다.
- 폐쇄책 모델은 성능이 매우 열악했으며(F1 = 2.6), 외부 검색 없이 다양한 다중 사실 질문에 대해 기억하거나 일반화하는 데의 어려움을 보여준다.
- NQ와 QAMPARI 양쪽에서 다중 작업 학습을 수행하면 QAMPARI 전용 학습 대비 성능 향상이 이루어져, 다양한 지도 신호의 유용성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.