Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Stage Conversational Passage Retrieval: An Approach to Fusing Term Importance Estimation and Neural Query Rewriting

Sheng-Chieh Lin, Jheng-Hong Yang|arXiv (Cornell University)|2020. 05. 05.
Topic Modeling참고 문헌 81인용 수 9
한 줄 요약

이 논문은 다단계 대화형 문장 검색 프레임워크를 제안하며, 역사적 쿼리 확장(역사적 쿼리 확장)을 통한 용어 중요도 추정과 T5 기반의 순서-순서 모델을 통한 신경망 기반 쿼리 재작성 방식을 융합하여 다단계 대화 쿼리에서의 모호성을 해결한다. 이 두 가지 쿼리 재작성 방법을 상호 순위 융합을 통해 조합함으로써, 최고의 TREC CAsT 2019 제출 결과보다 NDCG@3에서 30% 향상된 성능을 달성하여 새로운 최고의 성능 기록을 수립한다.

ABSTRACT

Conversational search plays a vital role in conversational information seeking. As queries in information seeking dialogues are ambiguous for traditional ad-hoc information retrieval (IR) systems due to the coreference and omission resolution problems inherent in natural language dialogue, resolving these ambiguities is crucial. In this paper, we tackle conversational passage retrieval (ConvPR), an important component of conversational search, by addressing query ambiguities with query reformulation integrated into a multi-stage ad-hoc IR system. Specifically, we propose two conversational query reformulation (CQR) methods: (1) term importance estimation and (2) neural query rewriting. For the former, we expand conversational queries using important terms extracted from the conversational context with frequency-based signals. For the latter, we reformulate conversational queries into natural, standalone, human-understandable queries with a pretrained sequence-tosequence model. Detailed analyses of the two CQR methods are provided quantitatively and qualitatively, explaining their advantages, disadvantages, and distinct behaviors. Moreover, to leverage the strengths of both CQR methods, we propose combining their output with reciprocal rank fusion, yielding state-of-the-art retrieval effectiveness, 30% improvement in terms of NDCG@3 compared to the best submission of TREC CAsT 2019.

연구 동기 및 목표

  • 다단계 대화에서 공호성 및 생략으로 인한 쿼리 모호성을 해결하기 위해.
  • 다단계 광범위 검색 파이프라인에 쿼리 재작성 기법을 통합하여 대화형 문장 검색(ConvPR)의 검색 효율성을 향상시키기 위해.
  • 용어 중요도 추정과 신경망 기반 쿼리 재작성 방식이라는 두 가지 다른 대화형 쿼리 재작성(CQR) 방법을 평가하고 비교하기 위해.
  • 두 가지 CQR 방법의 출력을 융합함으로써 개별 방법보다 더 높은 검색 성능을 달성할 수 있음을 입증하기 위해.
  • 규칙 기반과 신경망 기반 쿼리 재작성 기법의 상호보완적인 행동 양상에 대한 통찰을 제공하기 위해.

제안 방법

  • 역사적 쿼리 확장(HQE)을 제안하며, 빈도 기반 신호를 사용하여 대화적 맥락에서 중요한 용어를 추출하여 모호한 쿼리를 확장한다.
  • 신경망 전이 재작성(NTR)을 도입하며, T5 기반의 순서-순서 모델을 사용하여 대화형 쿼리를 독립적이고 인간이 읽을 수 있는 쿼리로 재작성한다.
  • 두 가지 CQR 방법을 다단계 정보 검색 파이프라인에 통합하며, 초기 검색에는 BM25를, 재순서에는 BERT를 사용한다.
  • 서로 다른 강점을 활용하기 위해, HQE와 NTR의 순위 결과를 상호 순위 융합(RRF)을 통해 융합한다.
  • 평가를 위해 TREC CAsT 2019 벤치마크를 사용하며, NDCG@3, MAP, R@1000를 성능 측정 지표로 사용한다.
  • NTR 모델의 다양한 비드 폭에 대해 CPU 및 TPU 지연 시간을 측정하여 추론 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1용어 중요도 추정과 신경망 기반 쿼리 재작성 방식은 대화형 쿼리의 모호성을 해결하는 데 어떻게 다른가?
  • RQ2빈도 신호 기반과 신경망 기반 순서-순서 모델링 기반의 두 가지 다른 CQR 방법을 융합하면 검색 효율성이 향상되는가?
  • RQ3각 CQR 방법이 NDCG@3 및 MAP와 같은 후행 검색 지표에 미치는 상대적 영향은 어떠한가?
  • RQ4HQE와 NTR의 출력을 융합한 결과는 개별 방법과 최고의 TREC CAsT 2019 제출 결과보다 어떻게 비교되는가?
  • RQ5신경망 기반 쿼리 재작성의 계산 비용은 얼마이며, 비드 폭은 효율성과 효과성에 어떤 영향을 미치는가?

주요 결과

  • 서로 다른 강점을 활용하기 위해 상호 순위 융합을 통해 HQE와 NTR를 융합한 결과, 최고의 TREC CAsT 2019 제출 결과보다 NDCG@3에서 23% 향상된 성능을 달성했다.
  • NTR만으로도 최고의 TREC CAsT 2019 제출 결과보다 NDCG@3에서 18% 향상되어 인간의 쿼리 재작성 방식을 모방하는 데 강력한 성능을 보였다.
  • HQE는 대화적 맥락에서 유도된 주제 관련 关련 키워드를 빈도 기반 용어 중요도 신호를 통해 효과적으로 확장하는 데 뛰어난 성능을 보였다.
  • 비드 폭 w=1인 NTR 모델은 비신경망 기반 HQE 모델과 유사한 추론 지연 시간을 기록했으며, 더 높은 비드 폭(w=5,10)은 효과성 향상에 있어 근소한 성과 향상만을 가져다주었다.
  • BERT 재순서 모델은 TPU에서 쿼리당 평균 3.29초의 계산 오버헤드를 유발하여, 후기 융합 대비 조기 융합의 효율성 우수성을 강력히 입증했다.
  • 사례 연구 결과, NTR는 더 자연스럽고 인간처럼 들리는 쿼리를 생성하지만, HQE는 빈도 기반 확장을 통해 핵심 용어를 더 잘 유지하는 것으로 나타나 상호보완적인 강점을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.