Skip to main content
QUICK REVIEW

[논문 리뷰] MIREX: MapReduce Information Retrieval Experiments

Djoerd Hiemstra, Claudia Hauff|arXiv (Cornell University)|2010. 04. 26.
Information Retrieval and Search Behavior참고 문헌 9인용 수 15
한 줄 요약

이 논문은 맵리듀스를 활용해 클러스터를 통해 문서 컬렉션을 순차적으로 스캔함으로써 대규모 정보 검색 실험의 효율성을 높이고자 한다. 이는 코딩 노력 감소와 프로토타ип 개발 가속화를 가능하게 한다. 15台의 머신으로 구성된 클러스터를 사용하여 시스템은 0.5억 개의 웹 페이지를 11시간 내에 처리했으며, 상위 5개 결과에서 TREC 수준의 정밀도(0.42)를 달성했다. 5,000개의 쿼리로 확장했을 때 단일 노드 기반 Lemur보다 쿼리 처리량에서 뛰어난 성능을 보였다.

ABSTRACT

We propose to use MapReduce to quickly test new retrieval approaches on a cluster of machines by sequentially scanning all documents. We present a small case study in which we use a cluster of 15 low cost ma- chines to search a web crawl of 0.5 billion pages showing that sequential scanning is a viable approach to running large-scale information retrieval experiments with little effort. The code is available to other researchers at: http://mirex.sourceforge.net

연구 동기 및 목표

  • 레미어나 테리어와 같은 통합 검색 시스템에 통합되는 것을 피함으로써 새로운 검색 알고리즘을 구현하는 데 소요되는 시간과 복잡성을 줄이기 위해.
  • 앵커 텍스트나 전체 텍스트 분석과 같이 색인되지 않은 문서 특징이 필요한 새로운 랭킹 함수를 연구자들이 쉽게 실험할 수 있도록 하기 위해.
  • 순차적 스캔을 통해 맵리듀스를 활용한 방법이 실험적 정보 검색 연구를 위한 타당하고 확장 가능하며 효율적인 대안이 될 수 있음을 보여주기 위해.
  • 일반적인 클러스터에서 빠른 프로토타ип 개발을 위한 오픈소스이자 경량의 프레임워크를 제공하기 위해.

제안 방법

  • 맵퍼는 각 문서를 병렬로 처리하며, 사용자 정의 검색 함수를 사용해 모든 쿼리에 대해 점수를 매긴다.
  • 각 문서에 대해 맵퍼는 (QueryID, (DocID, Score)) 쌍을 출력하여 전체 컬렉션에 걸쳐 관련성 점수를 분산 계산할 수 있도록 한다.
  • 리듀서는 각 쿼리당 상위 1000개 결과를 유지하기 위해 크기가 1000인 최소 힙을 유지함으로써 가장 높은 점수를 가진 문서들만 유지한다.
  • 리듀서는 또한 커비너로 기능하여 노드 간 데이터 전송을 줄이며, 셔플링 전에 로컬에서 결과를 필터링함으로써 네트워크 오버헤드를 감소시킨다.
  • 이 방법은 하둡의 내장 장애 복구 및 로드 밸런싱 기능을 활용하여 특수한 인프라 없이도 일반 클러스터에서 실행이 가능하다.
  • 스코링 함수를 쉽게 수정할 수 있도록 하여 재색인화나 복잡한 시스템 통합 없이도 점진적인 실험을 지원한다.

실험 결과

연구 질문

  • RQ1대규모 문서 컬렉션에 대한 맵리듀스 기반 순차 스캔이 실험적 정보 검색 연구를 위한 전통적인 역인덱스 기반 검색 시스템에 비해 실용적이고 효율적인 대안이 될 수 있는가?
  • RQ2레미어나 테리어와 같은 기존 시스템에 통합하는 것과 비교해 맵리듀스를 통해 새로운 검색 방법을 개발하고 실행하는 데 소요되는 시간은 어떻게 다른가?
  • RQ3맵리듀스 기반 시스템의 성능은 쿼리 부하 증가에 따라 어떻게 확장되며, 기존의 단일 노드 및 분산 버전의 시스템과 비교해 어떻게 되는가?
  • RQ4맵리듀스 기반 순차 스캔은 표준 TREC 테스트 컬렉션에서 경쟁 가능한 검색 품질(예: 평균 평균 정밀도)을 달성할 수 있는가?

주요 결과

  • 맵리듀스 기반 시스템은 ClueWeb09 데이터셋에서 상위 5개 결과에서 정밀도 0.42를 달성했으며, 이는 TREC 2009 대회 최상위 성능 수준과 유사했다.
  • 0.5억 개의 웹 페이지에서 앵커 텍스트 추출 작업을 15대의 머신 클러스터에서 11시간 내에 수행했으며, 400GB의 색인 텍스트를 생성했다.
  • 프리프로세싱 이후 5,000개의 쿼리를 처리하는 데 30분 미만이 소요되었으며, 평균 쿼리당 1.6초의 응답 시간을 기록했다.
  • 50개의 쿼리에 대해서는 단일 노드 기반 레미어 시스템보다 3.6배 느렸지만, 쿼리 부하가 증가함에 따라 캐싱과 병렬 처리 덕분에 더 빠른 성능을 보였다.
  • 전체 시스템의 코드베이스는 레미어나 테리어와 같은 시스템의 50만 줄 이상에 비해 단 350줄에 불과했으며, 이는 개발 효율성 향상을 입증했다.
  • 쿼리 수에 따라 성능이 부분선형적으로 증가하며, 캐싱과 병렬 쿼리 처리의 이점 덕분에 대규모 배치 실험에 매우 효율적인 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.