Skip to main content
QUICK REVIEW

[논문 리뷰] The Anatomy of Mitos Web Search Engine

Panagiotis Papadakos, Giorgos Vasiliadis|ArXiv.org|2008. 03. 14.
Web Data Mining and Analysis참고 문헌 11인용 수 8
한 줄 요약

이 논문은 DBMS 기반 인덱스를 사용하여 확장성, 유지보수성, 고기능을 갖춘 정보 검색을 가능하게 하는 웹 검색 엔진인 Mitos를 제시한다. Terrier와 같은 역인verted 파일 시스템에 비해 저장소 사용량이 많고 쿼리 성능이 떨어지지만, 그리스어 어간 추출, 실시간 결과 클러스터링, 링크 분석을 통한 스팸 검출과 같은 고급 기능을 지원하며, 2,892초 동안 14,246개 문서(전체 컬렉션의 97% 이상)를 인덱싱하는 데 성공했다. 이는 Terrier가 11,694초 동안 11,699개 문서(80.6%)를 인덱싱한 것과 비교하여 뛰어난 성능을 보였다.

ABSTRACT

Engineering a Web search engine offering effective and efficient information retrieval is a challenging task. This document presents our experiences from designing and developing a Web search engine offering a wide spectrum of functionalities and we report some interesting experimental results. A rather peculiar design choice of the engine is that its index is based on a DBMS, while some of the distinctive functionalities that are offered include advanced Greek language stemming, real time result clustering, and advanced link analysis techniques (also for spam page detection).

연구 동기 및 목표

  • 고급 언어 처리 및 실시간 결과 정리 기능을 지원하는 고기능적이고 확장 가능한 웹 검색 엔진을 설계하고 구현하기.
  • 기존의 역인verted 파일 대신 DBMS를 주 인덱스 구조로 사용할 경우의 성능적 타협점을 평가하기.
  • 다국어 환경에서 어간 추출이 검색 정확도, 대체 문서 생성, 쿼리 확장에 미치는 영향을 조사하기.
  • 실시간 결과 클러스터링 및 분류 체계 구축의 실현 가능성과 성능을 실세계 웹 컬렉션과 유사한 환경에서 탐색하기.
  • 실제 웹 컬렉션을 기반으로 기존의 IR 시스템인 Terrier와의 성능 및 확장성 비교 분석하기.

제안 방법

  • 시스템은 관계형 DBMS를 사용하여 역인verted 인덱스를 저장함으로써 스키마의 유연성과 삭제되거나 새로 크롤링된 문서에 대한 효율적인 업데이트를 가능하게 한다.
  • 크롤러는 웹 페이지를 재귀적으로 가져오며 고유한 ID를 부여하고 메타데이터 및 하이퍼링크를 구조화된 파일에 저장한다.
  • 인덱서는 어휘 분석, 정지어 제거, 그리스어 어간 추출을 수행한 후, 텀 빈도, 가중치, PageRank를 DBMS에 저장한다.
  • 쿼리 처리는 벡터 모델, 불리안 모델, 확장 불리안 모델, 퍼지 모델을 모두 지원하며, 상위 랭킹 결과를 기반으로 쿼리 제안 및 확장을 수행한다.
  • 실시간 결과 클러스터링은 여러 알고리즘을 사용하여 적용되며, 추출된 전체 텍스트에서 문서 서rogate를 생성한다.
  • 스팸 검출은 의심스러운 페이지를 식별하여 인간의 검토에 넘기고, 이를 통해 링크 분석 기반 랭킹을 개선함으로써 향상된다.

실험 결과

연구 질문

  • RQ1웹 검색에서 DBMS 기반 인덱스는 기존의 역인verted 파일 시스템에 비해 저장소 사용량, 색인 시간, 쿼리 성능 측면에서 어떻게 비교되는가?
  • RQ2고급 그리스어 어간 추출이 검색 재현율, 색인 크기, 쿼리 제안 및 문서 서rogate의 품질에 미치는 영향은 무엇인가?
  • RQ3실시간 결과 클러스터링이 웹 검색 엔진에서 사용자 탐색과 결과 정리에 얼마나 기여하는가?
  • RQ4의심스러운 페이지에 대한 인간의 피드백을 통합한 링크 분석이 스팸 검출에 얼마나 효과적인가?
  • RQ5더 큰 문서 컬렉션으로 확장할 경우 DBMS 기반 인덱스 시스템의 성능 특성은 어떠한가?

주요 결과

  • Mitos는 2,892초 동안 14,246개 문서(컬렉션의 97.2%)를 색인했으며, 이는 Terrier v.1.1이 11,694초 동안 11,699개 문서(80.6%)를 색인한 것에 비해 뚜렷한 성능 향상을 보였다.
  • DBMS 기반 인덱스는 총 저장소의 7.4%인 214.99MB를 사용했으며, Terrier의 0.8%인 23.8MB보다 상당한 저장소 오버헤드를 보였다.
  • Mitos의 쿼리 평가 시간은 쿼리 키워드 수가 증가함에 따라 증가했으며, 10개 키워드 기준 평균 0.3212초였고, Terrier는 모든 쿼리 길이에서 밀리초 이내(0.0044초)의 일관된 성능을 유지했다.
  • 더 느린 성능에도 불구하고, Mitos는 Terrier보다 평균 90.23개의 더 많은 결과를 검색하여 재현율이 높았다.
  • 어간 추출은 재현율을 향상시키고 색인 크기를 줄였지만, 클러스터 이름의 가독성과 쿼리 확장 제안의 품질에 악영향을 미쳤다.
  • 코퍼스 내 단어 빈도 분포는 힘의 법칙 분포를 따르며, 이는 시스템 설계 시 표준 IR 가정의 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.