Skip to main content
QUICK REVIEW

[논문 리뷰] RECONSIDER: Re-Ranking using Span-Focused Cross-Attention for Open Domain Question Answering

Srinivasan Iyer, Sewon Min|arXiv (Cornell University)|2020. 10. 21.
Topic Modeling참고 문헌 20인용 수 8
한 줄 요약

ReConsider는 사전 훈련된 MRC 모델의 고신뢰도 예측을 정밀하게 다듬는 스파이크 집중형 재순서 모델을 제안한다. 스파이크 애너테이션된 패assing과 집중형 크로스 어텐션을 사용하여, 자연질문(Natural Questions)에서 45.5%의 정확 일치(exact match)와 트리비아QA(TriviaQA)에서 61.7%의 정확 일치를 기록하며 최신 기술(SOTA) 성능을 달성한다. 이는 일부 경우에서 기존의 생성형 모델조차도 능가한다.

ABSTRACT

State-of-the-art Machine Reading Comprehension (MRC) models for Open-domain Question Answering (QA) are typically trained for span selection using distantly supervised positive examples and heuristically retrieved negative examples. This training scheme possibly explains empirical observations that these models achieve a high recall amongst their top few predictions, but a low overall accuracy, motivating the need for answer re-ranking. We develop a simple and effective re-ranking approach (RECONSIDER) for span-extraction tasks, that improves upon the performance of large pre-trained MRC models. RECONSIDER is trained on positive and negative examples extracted from high confidence predictions of MRC models, and uses in-passage span annotations to perform span-focused re-ranking over a smaller candidate set. As a result, RECONSIDER learns to eliminate close false positive passages, and achieves a new state of the art on four QA tasks, including 45.5% Exact Match accuracy on Natural Questions with real user questions, and 61.7% on TriviaQA.

연구 동기 및 목표

  • 개방형 QA에서 높은 재현율을 보이지만 정확도가 낮은 상위 예측의 정확도를 향상시키기 위해 후보 답변 스파이크를 재순서하는 것.
  • 추출형 QA에서 의미적으로 유사한 잘못된 예측(false positives)과 정답을 더 잘 구분할 수 있도록 개선하는 것.
  • 고신뢰도 MRC 예측과 스파이크 애너테이션을 활용한 단순하고 일반화 가능한 재순서 방법을 개발하는 것.
  • 기존의 검색 증강형 및 생성형 모델보다 추출형 QA 벤치마크에서 뛰어난 성능을 내는 것.
  • 특정 스파이크에 집중된 추론이 표준 스파이크 선택보다 성능 향상에 기여하는지 입증하는 것.

제안 방법

  • ReConsider는 기존 MRC 모델(예: DPR)의 고신뢰도 예측에서 추출한 양성 및 음성 예시를 기반으로 훈련된다.
  • 각 패assing은 후보 답변 스파이크로 표시되어 질문과 애너테이션된 스파이크 간의 스파이크 집중형 크로스 어텐션을 가능하게 한다.
  • 모델는 특정 스파이크에 집중하는 크로스 어텐션을 갖춘 BERT 기반 아키텍처를 사용하여 후보 답변에 대한 추론을 향상시킨다.
  • 기본 MRC 모델의 상위-K 예측(예: 상위-100)을 재순서하여 그 중에서 가장 확신도가 높은 스파이크를 선택한다.
  • 훈련 중 하드 음성 예제를 사용하며, 이는 의미적으로 유사하지만 잘못된 답변에서 유래하여 구분 능력을 향상시킨다.
  • 이 방법은 대규모 사전 훈련된 모델과 호환되며, 연결 기반 재순서의 한계를 피할 수 있다.

실험 결과

연구 질문

  • RQ1특정 답변 스파이크에 집중된 재순서 모델이 추출형 개방형 QA 성능 향상에 기여하는가?
  • RQ2고신뢰도 MRC 예측에서 유도된 더 어려운, 더 미묘한 잘못된 예측으로 훈련하면 일반화 능력이 향상되는가?
  • RQ3스파이크 집중형 크로스 어텐션은 표준 MRC 모델보다 유사한 잘못된 예측을 더 잘 구분할 수 있는가?
  • RQ4ReConsider은 최신 기술의 검색 증강형 및 생성형 QA 모델과 비교해 어떻게 성능을 내는가?
  • RQ5스파이크 애너테이션을 사용하면 답변 연결 방식과 비교해 재순서 정확도가 상당히 향상되는가?

주요 결과

  • ReConsider은 자연질문(Natural Questions) 테스트 세트에서 45.5%의 정확 일치를 기록하며, 소형 모델을 사용한 이전 최신 기술(DPR)보다 1.6% 향상되었다.
  • 트리비아QA(TriviaQA)에서는 61.7%의 정확 일치를 달성하여, 소형 모델 기반 이전 최신 기술보다 2.5% 향상되었다.
  • ReConsider의 대형 모델 버전은 모든 데이터셋에서 BERT-large 기반 DPR보다 약 1% 높은 성능을 보였으며, 트리비아QA에서 61.1%의 정확 일치를 기록했다.
  • ReConsider은 BART-large를 사용한 RAG 모델보다 자연질문(NQ)에서 1%, 트리비아QA에서 5.5%, TREC에서 3% 높은 성능을 보여 추출형 QA에서 뛰어난 성능을 입증했다.
  • 답변 연결 방식 대비 스파이크 애너테이션을 사용할 경우 자연질문(NQ)에서 검증 정확도가 1% 향상되어 집중 모델링의 중요성을 확인했다.
  • 추론 시 K=5 예측을 사용할 때 모델 성능이 가장 뛰어나며, K를 늘려도 영향을 거의 받지 않아 후보 집합 크기 변화에 대해 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.