Skip to main content
QUICK REVIEW

[논문 리뷰] Ranking Paragraphs for Improving Answer Recall in Open-Domain Question Answering

Jinhyuk Lee, Seongjun Yun|arXiv (Cornell University)|2018. 10. 01.
Topic Modeling참고 문헌 18인용 수 13
한 줄 요약

이 논문은 개방형 질의응답에서 답변 복귀를 향상시키기 위해 검색된 문서의 문단을 재정렬하는 러닝-투-랭크 모델인 Paragraph Ranker를 제안한다. Bi-LSTM 인코더와 간단한 유사도 함수(내적, 이차형식, MLP)를 사용하여 독자 모델에 공급하기 전에 가장 관련성이 높은 문단을 선별함으로써, 독자 아키텍처를 수정하지 않고도 네 개의 데이터셋에서 평균 7.8% 향상된 정확일치 점수를 달성한다.

ABSTRACT

Recently, open-domain question answering (QA) has been combined with machine comprehension models to find answers in a large knowledge source. As open-domain QA requires retrieving relevant documents from text corpora to answer questions, its performance largely depends on the performance of document retrievers. However, since traditional information retrieval systems are not effective in obtaining documents with a high probability of containing answers, they lower the performance of QA systems. Simply extracting more documents increases the number of irrelevant documents, which also degrades the performance of QA systems. In this paper, we introduce Paragraph Ranker which ranks paragraphs of retrieved documents for a higher answer recall with less noise. We show that ranking paragraphs and aggregating answers using Paragraph Ranker improves performance of open-domain QA pipeline on the four open-domain QA datasets by 7.8% on average.

연구 동기 및 목표

  • 기존 정보 검색 시스템이 답변을 포함한 문서를 검색하는 데에 한계를 보이며 이로 인해 개방형 QA 성능이 저하되는 문제를 해결하기 위해.
  • 문서 수준 검색에만 의존하는 것 대신, 검색된 문서 내의 문단을 정렬하여 개방형 QA에서 답변 복귀를 향상시키기 위해.
  • 독자 모델에 공급하기 전에 낮은 순위의 내용을 필터링하여 불필요한 노이즈를 줄이기 위해.
  • 기본 독자 모델을 수정하지 않고도 문단 수준의 재정렬이 QA 성능을 크게 향상시킬 수 있음을 입증하기 위해.
  • 기존 엔드 투 엔드 러닝-투-랭크 접근법과 보완할 수 있는 간단하면서도 효과적인 방법을 제공하기 위해.

제안 방법

  • Paragraph Ranker는 질문과 문단을 모두 밀도 있는 표현으로 인코딩하기 위해 양방향 LSTM(Bi-LSTM)을 사용한다.
  • 내적, 이차형식 또는 다층 퍼셉트론(MLP)과 같은 유사도 함수를 사용하여 특정 문단이 답변을 포함할 확률을 계산한다.
  • 대규모 문단 쌍에서 효율적으로 학습하기 위해 음성 샘플링을 활용하여 계산 비용을 절감한다.
  • 예를 들어 N=20개의 검색된 문서에서 예측된 관련성 점수 기반으로 상위 M개의 문단(예: M=200)을 선별한다.
  • 상위 랭킹 문단들 간의 중복 답변에 대한 비정규화된 확률을 조합하는 커버리지 기반 방법을 사용해 답변을 집계한다.
  • 문서 검색과 문서 독해 사이에 Paragraph Ranker를 통합하여 복귀율을 향상시키고 노이즈를 필터링한다.

실험 결과

연구 질문

  • RQ1독자 모델 아키텍처를 수정하지 않고도 문단 수준의 재정렬이 개방형 질의응답에서 답변 복귀를 향상시킬 수 있는가?
  • RQ2전통적인 문서 검색 및 엔드 투 엔드 러닝-투-랭크 방법과 비교할 때, 정확일치 성능 측면에서 Paragraph Ranker는 어떻게 성과를 내는가?
  • RQ3문단 정렬과 결합했을 때, 검색된 문서 수를 늘리는 것이 복귀율 향상에 어느 정도 기여하는가?
  • RQ4내적, 이차형식, MLP 중 어떤 유사도 함수가 효율성과 성능 사이의 최적의 균형을 이룰 수 있는가?
  • RQ5검색 시스템에서 상위 문서가 질문과 관련이 없더라도 Paragraph Ranker는 관련성이 높은 문단을 효과적으로 식별할 수 있는가?

주요 결과

  • Paragraph Ranker + Full Agg.은 기준 모델 DrQA 대비 네 개의 개방형 QA 데이터셋에서 평균 7.8% 향상된 정확일치 점수를 달성한다.
  • SQuAD_OPEN에서 이 방법은 정확일치 점수에서 기존 DrQA 및 강화된 리더-랭커(R³) 모델을 모두 능가하며 3.78% 상대적 향상률을 기록한다.
  • CuratedTrec에서는 상대적 향상률이 24.65%에 이르며, 복잡하거나 모호한 질의가 많은 데이터셋에서 뚜렷한 성과를 보인다.
  • SQuAD 개발 세트에서 검증된 결과, 상위 5개 문단에서 96.7%의 높은 복귀율을 유지하면서도 관련 없는 내용을 효과적으로 필터링한다.
  • 정성적 분석 결과, 'play'와 같은 다의어어휘를 포함한 질문에서도 검색기의 상위 문서가 관련이 없더라도 Paragraph Ranker가 관련 문단을 정확히 식별함을 확인할 수 있었다.
  • MLP와 같은 더 복잡한 모델에 비해 상당히 낮은 추론 비용으로도 간단한 점수 함수(예: 내적)가 유사한 성능을 달성함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.