Skip to main content
QUICK REVIEW

[논문 리뷰] Training a Ranking Function for Open-Domain Question Answering

Phu Mon Htut, Samuel R. Bowman|arXiv (Cornell University)|2018. 04. 12.
Topic Modeling참고 문헌 8인용 수 6
한 줄 요약

이 논문은 개방형 도메인 질의응답을 위한 두 가지 신경망 랭커를 제안한다: 하나는 의미 유사성 기반(InferSent)이고, 다른 하나는 단어 수준의 관련성 매칭 기반(관계 네트워크)이다. 의미 유사성 랭커는 전반적인 QA 성능을 크게 향상시켜 기준 모델 대비 11.6% 향상시켰으며, 관련성 매칭 랭커는 높은 검색 재현율을 달성하지만 질문과의 의미적 일치도가 낮아 후속 QA 정확도가 떨어진다.

ABSTRACT

In recent years, there have been amazing advances in deep learning methods for machine reading. In machine reading, the machine reader has to extract the answer from the given ground truth paragraph. Recently, the state-of-the-art machine reading models achieve human level performance in SQuAD which is a reading comprehension-style question answering (QA) task. The success of machine reading has inspired researchers to combine information retrieval with machine reading to tackle open-domain QA. However, these systems perform poorly compared to reading comprehension-style QA because it is difficult to retrieve the pieces of paragraphs that contain the answer to the question. In this study, we propose two neural network rankers that assign scores to different passages based on their likelihood of containing the answer to a given question. Additionally, we analyze the relative importance of semantic similarity and word level relevance matching in open-domain QA.

연구 동기 및 목표

  • 검색 엔진이 추출한 문단을 신경망 랭킹 함수를 사용해 재정렬하여 개방형 도메인 질의응답 성능을 향상시키는 것.
  • 개방형 QA에서 의미 유사성과 단어 수준의 관련성 매칭 간 상대적 중요도를 조사하는 것.
  • 신경망 랭커가 개방형 환경에서 기계 독해 모델의 성능 향상에 기여할 수 있는지 평가하는 것.
  • 높은 검색 재현율 모델이 의미적 일치도가 떨어져 종단 간 QA에서 성능이 떨어지는 이유를 분석하는 것.

제안 방법

  • 전체 질문과 문단를 고정 크기의 분산 표현(InferSent)을 사용해 인코딩하는 의미 유사성 기반 랭커를 제안한다.
  • 질문과 문단의 단어 간 국소적 상호작용을 계산하는 관계 네트워크 기반의 단어 수준 관련성 매칭 랭커를 개발한다.
  • 모든 랭커를 QUASAR-T 데이터셋에서 훈련하여 주어진 질문에 대한 문단의 관련성 점수를 산출한다.
  • 각 랭커에서 상위 랭킹된 문단을 DrQA 파이프라인에 통합하여 신경 기계 독해 모델(BiDAF)과 결합한다.
  • QUASAR-T 테스트 세트에서 종단 간 QA 성능을 평가하기 위해 정확일치(EM) 및 F1 점수를 사용한다.
  • 랭커 간 검색 재현율(정답이 상위-N 문단에 포함된 비율)을 비교한다.

실험 결과

연구 질문

  • RQ1분산 문장 표현에서의 의미 유사성이 단어 수준 매칭 대비 개방형 QA 성능 향상에 기여하는가?
  • RQ2단어 수준의 관련성 매칭은 어느 정도 개방형 QA에서 검색 재현율을 향상시키는가?
  • RQ3높은 재현율을 달성한 검색 모델이 정답 포함 문단을 추출함에도 불구하고 종단 간 QA 정확도 향상에 실패하는 이유는 무엇인가?
  • RQ4의미 유사성과 국소적 단어 매칭을 결합한 하이브리드 랭킹 모델이 더 나은 전체 QA 성능을 달성할 수 있는가?

주요 결과

  • 의미 유사성에 기반한 InferSent 랭커는 기준 DrQA 시스템 대비 전체 QA 성능을 11.6% 향상시켰다.
  • 관계 네트워크 랭커는 InferSent(56.7%) 및 기준 모델(54.5%) 대비 높은 검색 재현율(상위 10개에서 70.3%)을 달성하여 뛰어난 검색 능력을 보였다.
  • 높은 재현율에도 불구하고 관계 네트워크 랭커는 QA 성능이 낮아졌는데(EM: 26.0%), 이는 검색된 문단들이 질문과 의미적으로 일치하지 않는 경우가 많기 때문이다.
  • InferSent 랭커는 DrQA와 결합했을 때 EM 점수 31.2% 및 F1 점수 37.6%를 기록하여 몇몇 이전 최고 성능 모델을 능가했다.
  • 연구 결과 의미 유사성이 단어 수준 매칭보다 전체 QA 성능 향상에 더 큰 기여를 한다는 것이 확인되었으며, 이는 비록 후자가 검색 재현율에서 뛰어난 성능을 보이더라도 마찬가지였다.
  • 관계 네트워크 랭커는 질문과 의미적 연결이 전혀 없는 문단에도 높은 점수를 매길 수 있었는데, 이는 의미 있는 관련성 대신 공존 패턴을 학습하고 있을 가능성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.