Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Semantic and Lexical Matching to Improve the Recall of Document Retrieval Systems: A Hybrid Approach

Saar Kuzi, Mingyang Zhang|arXiv (Cornell University)|2020. 10. 02.
Information Retrieval and Search Behavior참고 문헌 45인용 수 15
한 줄 요약

이 논문은 어휘적(BM25) 및 의미적(딥 뉴럴 네트워크) 모델을 병렬로 조합하는 하이브리드 문서 검색 방법을 제안하여 재검색률을 향상시킨다. 사전 훈련된 언어 모델을 활용해 약한 지도 학습 기반의 의미적 매칭을 수행하고, 근사 KNN을 통해 결과를 융합함으로써, 단일 모델보다 훨씬 높은 재검색률을 달성한다. 이는 어휘적 겹침이 낮고, 문서 유형과 길이에 걸쳐 상호 보완적인 커버리지가 특징이다.

ABSTRACT

Search engines often follow a two-phase paradigm where in the first stage (the retrieval stage) an initial set of documents is retrieved and in the second stage (the re-ranking stage) the documents are re-ranked to obtain the final result list. While deep neural networks were shown to improve the performance of the re-ranking stage in previous works, there is little literature about using deep neural networks to improve the retrieval stage. In this paper, we study the merits of combining deep neural network models and lexical models for the retrieval stage. A hybrid approach, which leverages both semantic (deep neural network-based) and lexical (keyword matching-based) retrieval models, is proposed. We perform an empirical study, using a publicly available TREC collection, which demonstrates the effectiveness of our approach and sheds light on the different characteristics of the semantic approach, the lexical approach, and their combination.

연구 동기 및 목표

  • 정확한 쿼리 키워드가 없는 관련 문서를 놓치는 전통적인 어휘적 검색 모델의 재검색률 한계를 해결하기 위해.
  • 효율성에 대한 우려에도 불구하고, 재정렬 단계를 넘어서 검색 단계에서 딥 뉴럴 네트워크를 사용할 수 있는 가능성과 효과성을 탐색하기 위해.
  • 대규모 쿼리 로그가 필요 없고 시스템 효율성을 희생시키지 않는 실용적이고 구현에 유리한 하이브리드 시스템을 개발하기 위해.
  • 의미적 모델과 어휘적 모델이 서로 보완적이며, 서로 다른 특성의 독립적인 관련 문서 세트를 검색할 수 있음을 입증하기 위해.

제안 방법

  • 쿼리 로그에 의존하지 않는 사전 훈련된 언어 모델(예: BERT) 기반의 약한 지도 학습 작업을 활용해 의미적 검색 모델을 훈련한다.
  • 전체 문서 컬렉션에 대해 어휘적 모델(BM25)과 의미적 모델을 병렬로 검색한다.
  • 낮은 지연 시간을 확보하기 위해 근사 K-최근접 이웃(KNN) 검색을 사용해 상위-k 의미적 매칭 결과를 효율적으로 추출한다.
  • 두 모델의 결과 목록을 하나의 초기 검색 목록으로 융합하여 재정렬을 수행한다.
  • 의미적 모델을 사용해 문서를 밀도 벡터 임베딩으로 표현함으로써 의미 유사도 계산을 가능하게 한다.
  • t-SNE 시각화와 재작업 지수 분석을 통해 어휘적 및 의미적 결과 간의 어휘 겹침과 문서 클러스터링을 비교한다.

실험 결과

연구 질문

  • RQ1어휘적 모델와 병행하여 딥 뉴럴 네트워크 기반의 의미적 모델이 검색 단계에서 재검색률을 향상시킬 수 있는가?
  • RQ2어휘적 모델과 의미적 모델이 검색한 문서 세트는 어휘, 길이, 주제 커버리지 측면에서 어떻게 다를까?
  • RQ3어휘적 모델과 의미적 모델이 검색한 관련 문서 간의 겹침 정도는 어떠한가? 이는 상호 보완성을 시사하는가?
  • RQ4쿼리 로그 없이 훈련된 약한 지도 학습 기반의 의미적 모델도 여전히 효과적인 검색 성능을 달성할 수 있는가?
  • RQ5하이브리드 접근 방식은 실세계 검색 시스템에서의 시스템 효율성과 구현 가능성에 어떤 영향을 미치는가?

주요 결과

  • 의미적 모델은 어휘적 모델이 놓친 관련 문서를 검색했으며, 특히 정확한 쿼리 단어 대신 동의어나 어색한 표현을 사용한 문서에서 두드러졌다.
  • 의미적 모델과 어휘적 모델의 상위-100개 대표 어휘의 재작업 지수 평균은 0.162에 불과하여 매우 낮은 어휘 겹침을 나타낸다.
  • 의미적 모델이 검색한 문서는 어휘적 모델이 검색한 문서보다 평균적으로 훨씬 길었으며, 일부 경우에서 두 배 이상의 차이가 있었다.
  • t-SNE 시각화 결과, 의미적 결과는 종종 문서 임베딩 공간에서 어휘적 결과가 희박한 영역에 위치한 별도의 클러스터를 형성했다.
  • 하이브리드 접근 방식은 初기 검색 목록의 다양성과 주제 커버리지 향상에 기여했으며, 두 모델 간 강력한 보완성이 있음을 입증했다.
  • 이 방법은 효율적이고 구현에 유리하며, 근사 KNN과 오픈소스 도구를 사용해 대규모 훈련 데이터나 쿼리 로그가 필요 없이도 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.