Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Evolutionary Concept Distances for Effective Information Retrieval in Query Expansion

Valentina Franzoni, Yuanxi Li|arXiv (Cornell University)|2017. 01. 19.
Semantic Web and Ontologies참고 문헌 27인용 수 14
한 줄 요약

이 논문은 웹 문서 검색 정밀도를 향상시키기 위해 의미적 진화 개념 거리(semantic evolutionary concept distances, SECD)를 사용하는 새로운 질의 확장 방법을 제안한다. PMING 거리—검색 엔진에서 유도된 통계적 의미적 밀도 측정 기준—를 활용하여 기존 온톨로지 기반 방법보다 더 효과적으로 관련 개념 확장을 식별하고 순위를 매김으로써 실험 평가에서 검색 품질을 크게 향상시킨다.

ABSTRACT

In this work several semantic approaches to concept-based query expansion and reranking schemes are studied and compared with different ontology-based expansion methods in web document search and retrieval. In particular, we focus on concept-based query expansion schemes, where, in order to effectively increase the precision of web document retrieval and to decrease the users browsing time, the main goal is to quickly provide users with the most suitable query expansion. Two key tasks for query expansion in web document retrieval are to find the expansion candidates, as the closest concepts in web document domain, and to rank the expanded queries properly. The approach we propose aims at improving the expansion phase for better web document retrieval and precision. The basic idea is to measure the distance between candidate concepts using the PMING distance, a collaborative semantic proximity measure, i.e. a measure which can be computed by using statistical results from web search engine. Experiments show that the proposed technique can provide users with more satisfying expansion results and improve the quality of web document retrieval.

연구 동기 및 목표

  • 부적절한 질의 확장으로 인한 웹 문서 검색 정밀도 저하 문제를 해결하기 위해.
  • 가장 적합한 개념 기반 질의 확장을 신속하게 식별하여 사용자 브라우징 시간을 단축하기 위해.
  • 후보 개념 간의 의미적 밀도를 더 효과적으로 측정하여 질의 확장 품질을 향상시키기 위해.
  • 실제 검색 엔진 통계를 활용하여 확장 가능한 정확한 개념 거리 계산을 위한 방법을 개발하기 위해.
  • 검색 효과성 측면에서 기존 온톨로지 기반 질의 확장 기법을 능가하기 위해.

제안 방법

  • 이 방법은 웹 검색 엔진의 통계 결과에서 계산된 공동 의미적 밀도 측정 기준인 PMING 거리를 도입한다.
  • 원래 질의어에 대한 후보 개념의 PMING 거리를 기반으로 질의 확장에 적합한 개념을 선별하여 의미적 관련성을 확보한다.
  • 검색 엔진 피드백를 활용한 반복적 거리 개선을 통해 개념의 진화를 모델링하여 동적인 의미 관계를 포착한다.
  • 계산된 PMING 거리를 기반으로 확장된 질의를 순위 매기며, 가장 의미적으로 밀접한 개념을 우선순위로 배치한다.
  • 기존 검색 파이프라인에 쉽게 통합되어 질의 확장 및 재순서 정렬에 활용된다.
  • 실제 사용자 검색 행동 데이터에서 의미 유사도를 유도함으로써 정적 온톨로지에 의존하지 않는다.

실험 결과

연구 질문

  • RQ1검색 엔진에서 유도된 의미적 밀도 측정 기준은 개념 기반 질의 확장 품질을 향상시킬 수 있는가?
  • RQ2PMING 거리는 기존 온톨로지 기반 방법과 비교해 얼마나 잘 관련 질의 확장 후보를 식별하는가?
  • RQ3진화적 개념 거리를 사용할 경우 사용자 브라우징 시간은 얼마나 줄어들고 검색 정밀도는 얼마나 향상되는가?
  • RQ4명시적 지식 공학 기법 없이도 웹 검색 엔진 통계에서 의미 거리를 효과적으로 학습할 수 있는가?
  • RQ5제안된 방법은 웹 문서 검색에서 정밀도와 재현율 측면에서 기존 방법을 능가하는가?

주요 결과

  • 제안된 SECD 방법은 더 관련성이 높은 질의 확장 후보를 선별함으로써 검색 정밀도를 크게 향상시킨다.
  • PMING 거리 측정 기준은 수동 온톨로지 유지보수 없이도 검색 엔진 통계만을 사용하여 개념 간 의미 관계를 효과적으로 포착한다.
  • 실험 결과, 이 방법은 검색 과정 초반에 더 관련성이 높은 결과를 제공함으로써 사용자 브라우징 시간을 줄이는 데 기여한다.
  • 표준 검색 벤치마크에서 전통적인 온톨로지 기반 확장 기법 대비 정밀도와 재현율 지표에서 모두 뛰어난 성능을 보였다.
  • 진화적 개념 거리를 활용함으로써 의미 사용의 변화에 적응하는 바탕에서 시간이 지남에 따라 더 안정적이고 정확한 질의 확장이 가능해진다.
  • 특히 자원이 제한되거나 동적인 도메인에서 웹 문서 검색의 질의 확장 분야에서 최신 기술 수준의 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.