Skip to main content
QUICK REVIEW

[논문 리뷰] Incorporating Query Term Independence Assumption for Efficient Retrieval and Ranking using Deep Neural Networks

Bhaskar Mitra, Corby Rosset|arXiv (Cornell University)|2019. 07. 08.
Topic Modeling참고 문헌 30인용 수 21
한 줄 요약

이 논문은 BERT, Duet, CKNRM와 같은 딥 뉴럴 정보 검색 모델에 검색어 용어 독립성(query term independence)을 통합하여 오프라인에서 사전에 계산된 용어-문서 점수를 가능하게 하여, 쿼리 평가 비용을 크게 줄이고도 높은 검색 효과성을 유지하도록 제안한다. 놀랍게도 Duet와 CKNRM는 성능 저하가 크게 없으며, BERT는 소량의 성능 저하만 보이며, 이는 전체 컬렉션에 대한 효율적인 검색을 가능하게 하여 후단 재정렬에만 국한되지 않는 모델 활용을 가능하게 한다.

ABSTRACT

Classical information retrieval (IR) methods, such as query likelihood and BM25, score documents independently w.r.t. each query term, and then accumulate the scores. Assuming query term independence allows precomputing term-document scores using these models---which can be combined with specialized data structures, such as inverted index, for efficient retrieval. Deep neural IR models, in contrast, compare the whole query to the document and are, therefore, typically employed only for late stage re-ranking. We incorporate query term independence assumption into three state-of-the-art neural IR models: BERT, Duet, and CKNRM---and evaluate their performance on a passage ranking task. Surprisingly, we observe no significant loss in result quality for Duet and CKNRM---and a small degradation in the case of BERT. However, by operating on each query term independently, these otherwise computationally intensive models become amenable to offline precomputation---dramatically reducing the cost of query evaluations employing state-of-the-art neural ranking models. This strategy makes it practical to use deep models for retrieval from large collections---and not restrict their usage to late stage re-ranking.

연구 동기 및 목표

  • 검색어 용어 독립성을 활용하여 최신 딥 뉴럴 정보 검색 모델을 효율적이고 확장 가능한 검색에 활용하기 위해.
  • 검색어 용어 독립성 하에 사전에 계산된 용어-문서 점수의 영향을 신경망 모델의 검색 효과성에 미치는지 조사하기 위해.
  • 딥 뉴럴 모델을 대규모 정보 검색 시스템의 초기 단계 검색기로 실용적으로 활용하기 위해, 후단 재정렬이 아닌 첫 단계 검색에도 적용 가능하도록 하기 위해.
  • 강한 검색어 용어 독립성 하에서 효율성 향상과 잠재적 성능 저하 사이의 트레이드오프를 평가하기 위해.

제안 방법

  • BERT, Duet, CKNRM에 검색어 용어 독립성을 통합하기 위해 각 검색어 용어를 독립적으로 각 문서와 비교하여 점수를 계산하고, 선형적으로 점수를 통합한다.
  • 검색어 용어 독립성 가정 하에 신경망 모델을 사용하여 오프라인으로 모든 용어-문서 관련도 점수를 사전에 계산한다.
  • 역색인 인덱스와 영향도 순서(impact-ordering)를 활용하여 사전에 계산된 점수를 기반으로 쿼리 평가 시 후보 문서를 효율적으로 검색한다.
  • 표준 평가 지표(예: MRR, recall@1000)를 사용하여 MS MARCO 파assage 랭킹 벤치마크에서 결과 모델을 평가한다.
  • 검색어 용어 독립성 버전의 성능을 원본 모델 및 강력한 베이스라인인 BM25와 비교한다.
  • 소규모 검색 실험을 수행하여 사전 계산된 Duet 모델이 첫 단계 검색기로의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1BERT, Duet, CKNRM와 같은 딥 뉴럴 정보 검색 모델에 검색어 용어 독립성을 효과적으로 통합할 수 있는가? 이 경우 검색 효과성에 심각한 손실가 발생하는가?
  • RQ2검색어 용어 독립성 하에 사전에 계산된 용어-문서 점수로 쿼리 평가 비용을 얼마나 줄일 수 있으며, 이때 랭킹 품질은 어떻게 유지되는가?
  • RQ3검색어 용어 독립성을 가진 신경망 모델을 대규모 정보 검색 시스템의 첫 단계 검색기로 사용할 수 있는가? 후단 재정렬 전용이 아닌가?
  • RQ4검색어 용어 독립성 모델의 성능은 BM25 및 원본 모델 대비 검색 효과성 측면에서 어떻게 비교되는가?

주요 결과

  • 검색어 용어 독립성 Duet는 MS MARCO 개발 쿼리의 일부에서 recall@1000이 0.85, MRR@10이 0.218로, BM25(0.80 및 0.169)를 뛰어나게 성능을 냈다.
  • 원본 Duet 모델과 비교해 검색어 용어 독립성 Duet의 성능 저하가 통계적으로 유의미하지 않다.
  • 검색어 용어 독립성 CKNRM 모델도 원본 CKNRM 모델과 비교해 성능 저하가 유의미하지 않다.
  • 검색어 용어 독립성 BERT 모델은 MRR에서 소량이지만 측정 가능한 성능 저하가 있었지만, 여전히 공개 랭킹에서 비-BERT 모델을 능가했다.
  • 검색어 용어 독립성 Duet 모델은 사전 계산된 점수를 통해 BM25보다 더 나은 후보 집합을 추출했으며, 이는 향상된 첫 단계 검색 잠재력이 있음을 시사한다.
  • 결과적으로 Duet 및 CKNRM에 대해선 사전 계산로 인한 효율성 향상이 효과성 손실을 최소화하거나 전혀 유발하지 않으며, 이는 딥 뉴럴 모델을 전체 컬렉션 검색에 활용할 수 있음을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.