Skip to main content
QUICK REVIEW

[논문 리뷰] Query Expansion Strategy based on Pseudo Relevance Feedback and Term Weight Scheme for Monolingual Retrieval

Rekha Vaidyanathan, Sujoy Das|arXiv (Cornell University)|2015. 02. 18.
Information Retrieval and Search Behavior참고 문헌 8인용 수 4
한 줄 요약

이 논문은 등빈 빈도 문서 분할 기반의 새로운 용어 가중치 기반 및 가짜 관련 피드백을 활용한 단일 언어 정보 검색을 위한 질의 확장 방법을 제안한다. Terrier를 사용하여 FIRE 2011 히нд어 및 영어 테스트 컬렉션에서 검색 성능을 향상시키기 위해, 문서 파artition 내에서 tf-idf 점수를 계산하고, 최고 점수, 평균 점수 또는 최대 关键어 수를 기반으로 확장 용어를 선택함으로써 성능을 향상시킨다. 동적 선택을 위한 규칙 기반 모델이 제안되어 최적의 확장 용어를 자동으로 선정한다.

ABSTRACT

Query Expansion using Pseudo Relevance Feedback is a useful and a popular technique for reformulating the query. In our proposed query expansion method, we assume that relevant information can be found within a document near the central idea. The document is normally divided into sections, paragraphs and lines. The proposed method tries to extract keywords that are closer to the central theme of the document. The expansion terms are obtained by equi-frequency partition of the documents obtained from pseudo relevance feedback and by using tf-idf scores. The idf factor is calculated for number of partitions in documents. The group of words for query expansion is selected using the following approaches: the highest score, average score and a group of words that has maximum number of keywords. As each query behaved differently for different methods, the effect of these methods in selecting the words for query expansion is investigated. From this initial study, we extend the experiment to develop a rule-based statistical model that automatically selects the best group of words incorporating the tf-idf scoring and the 3 approaches explained here, in the future. The experiments were performed on FIRE 2011 Adhoc Hindi and English test collections on 50 queries each, using Terrier as retrieval engine.

연구 동기 및 목표

  • 질의 확장 기법을 향상시켜 단일 언어 정보 검색 성능을 향상시키는 것.
  • 기존 질의 확장 기법의 한계를 보완하기 위해 문서의 중심 주제에 가까운 용어의 상호관계를 중시하는 것.
  • 등빈도 문서 분할을 통해 문서 구조를 고려한 용어 가중치 기법을 개발하는 것.
  • 최고 점수, 평균 점수, 최대 关键어 수의 세 가지 전략을 평가하여 확장 용어를 선택하는 방법을 다루는 것.
  • 스코어링 및 구조 기반 기준을 바탕으로 최적의 확장 용어 그룹을 자동으로 선택하는 규칙 기반 통계 모델의 기초를 마련하는 것.

제안 방법

  • 가짜 관련 피드백을 통해 검색된 문서는 문서의 중심 주제에 대한 용어 분포를 분석하기 위해 등빈도 파artition으로 나뉜다.
  • 각 파artition 별로 용어 빈도-역문서 빈도(tf-idf) 점수를 계산하며, 역문서 빈도(idf)는 파artition 수를 기반으로 계산된다.
  • 확장 용어는 세 가지 다른 전략을 통해 선택된다: (1) 최고 점수를 받는 용어, (2) 파artition 간 평균 점수, (3) 높은 점수를 받는 키워드 수가 가장 많은 그룹.
  • 이 방법은 일반적으로 중간 파artition에 위치한 용어가 문서의 중심 아이디어에 더 가까워 더 관련성이 높다고 가정하며, 따라서 확장 용어 후보로 더 적합하다고 본다.
  • tf-idf 점수와 세 가지 선택 전략을 통합하여 최적의 용어 그룹을 동적으로 선택하는 규칙 기반 통계 모델이 제안된다.
  • 실험은 FIRE 2011 Adhoc 히нд어 및 영어 테스트 컬렉션의 각 50개 질의를 대상으로 Terrier 검색 엔진을 사용하여 수행된다.

실험 결과

연구 질문

  • RQ1등빈도 세그먼트로 문서를 분할하는 것이 관련 확장 용어 선정에 어떤 영향을 미치는가?
  • RQ2세 가지 용어 선택 전략 중에서—최고 점수, 평균 점수, 최대 关键어 수—중 어느 것이 가장 높은 검색 성능을 낳는가?
  • RQ3규칙 기반 모델이 tf-idf 스코어링과 구조 기반 용어 선택을 효과적으로 통합하여 질의 확장을 향상시킬 수 있는가?
  • RQ4문서의 중심 주제에 가까운 위치가 확장 용어의 관련성에 어떤 영향을 미치는가?
  • RQ5제안된 용어 가중치 기법은 기존 방법에 비해 단일 언어 검색 효과성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 등빈도 파artition를 통해 문서 중심 주제 근처의 용어에 집중함으로써 검색 효과성을 향상시킨다.
  • 세 전략 중에서 최고 점수를 받는 용어 접근 방식이 질의 간 일관성 있는 검색 성능 향상을 보였다.
  • 평균 점수 및 최대 关键어 수 전략은 질의 특성과 언어에 따라 효과가 다양하게 나타났다.
  • 연구는 문서 구조가 용어의 관련성에 상당한 영향을 미친다는 것을 입증하며, 분할 기반 용어 가중치의 유용성을 뒷받침한다.
  • 규칙 기반 모델은 스코어링 및 구조 기반 기준을 바탕으로 최적의 확장 용어 그룹을 동적으로 선택하는 데 실용적인 프레임워크로 기능함을 입증한다.
  • 이 방법은 FIRE 2011 벤치마크의 히нд어 및 영어 테스트 컬렉션 양쪽에서 측정 가능한 검색 성능 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.