Skip to main content
QUICK REVIEW

[논문 리뷰] Covidex: Neural Ranking Models and Keyword Search Infrastructure for the COVID-19 Open Research Dataset

Edwin Zhang, Nïkhil Gupta|arXiv (Cornell University)|2020. 07. 14.
Topic Modeling참고 문헌 22인용 수 7
한 줄 요약

Covidex는 CORD-19 오픈 연구 데이터셋을 위한 신경 순위 매기기 및 키워드 검색 인프라를 제공하며, Anserini를 통한 검색과 미세튜닝된 T5 모델을 활용한 신경 재순서 매기기를 결합합니다. TREC-COVID 라운드 3에서 피드백 기반 런 중 최고 점수를 기록하고, 완전히 자동화된 런 중 두 번째로 높은 점수를 기록하여, 오픈소스 도구와 베이스라인을 통해 최신 기술 수준의 성능과 광범위한 커뮤니티 영향을 입증합니다.

ABSTRACT

We present Covidex, a search engine that exploits the latest neural ranking models to provide information access to the COVID-19 Open Research Dataset curated by the Allen Institute for AI. Our system has been online and serving users since late March 2020. The Covidex is the user application component of our three-pronged strategy to develop technologies for helping domain experts tackle the ongoing global pandemic. In addition, we provide robust and easy-to-use keyword search infrastructure that exploits mature fusion-based methods as well as standalone neural ranking models that can be incorporated into other applications. These techniques have been evaluated in the ongoing TREC-COVID challenge: Our infrastructure and baselines have been adopted by many participants, including some of the highest-scoring runs in rounds 1, 2, and 3. In round 3, we report the highest-scoring run that takes advantage of previous training data and the second-highest fully automatic run.

연구 동기 및 목표

  • 팬데믹 기간 동안 빠른 정보 접근을 지원하기 위해 CORD-19 데이터셋에 대한 강력하고 커뮤니티가 접근 가능한 검색 인프라 개발.
  • 의료 텍스트에 대해 T5 모델을 미세튜닝하고 다단계 검색 파이프라인에 통합함으로써 신경 순위 매기기 기술을 발전.
  • 도메인 전문가가 관련 과학 문헌을 효율적으로 검색할 수 있도록 기능하는 엔드 투 엔드 검색 애플리케이션(covidex.ai)을 구축.
  • TREC-COVID 챌린지에서 고성능 제출을 가능하게 하는 오픈소스 기반 및 인프라 제공.
  • 융합 기반 키워드 검색과 신경 재순서 매기기의 생물의학 정보 검색에서의 효과성 입증.

제안 방법

  • 초기 검색은 Anserini IR 툴킷을 사용하여 수행되며, XML 어댑터를 통해 CORD-19 논문을 인덱싱하고 개요, 전문, 문단에서의 백오프워드 쿼리 지원.
  • 다중 인덱스(개요, 전문, 문단)의 순위를 상호 역순위 융합(RRF)하여 키워드 검색 결과의 검색 효과를 향상.
  • 초기 후보 집합을 재순서하기 위해 각각 MS MARCO와 MS MARCO의 의료 서브셋에 대해 미세튜닝된 monoT5-3B 및 duoT5 모델을 사용한 신경 재순서 매기기 수행.
  • 유사도 평가 결과를 기반으로 분류기 출력과 신경 점수를 혼합 가중치 0.5로 조합하는 분류 기반 피드백 메커니즘이 적용되어 결과를 정밀하게 개선.
  • 질문 필드에서 추출한 명시적 개체명을 사용해 주제 쿼리를 확장함으로써 어휘 커버리지와 관련성 향상. ScispaCy를 활용.
  • 시스템은 covidex.ai에서 엔드 투 엔드 검색 엔진으로 배포되었으며, TREC-COVID 챌린지 제출의 기초로도 기능함.

실험 결과

연구 질문

  • RQ1CORD-19 데이터셋에서 생물의학 질문 응답을 위한 다단계 검색 파이프라인(키워드 검색 및 신경 재순서 매기기 조합)의 효과성은 어떠한가?
  • RQ2질문 필드의 명시적 개체명을 사용한 쿼리 확장 기법이 기준 키워드 쿼리 대비 검색 성능 향상에 얼마나 기여하는가?
  • RQ3오픈소스 신경 순위 매기기 모델과 검색 인프라가 TREC-COVID 챌린지에서 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ4유사도 평가 결과를 기반으로 한 재순서 매기기와 완전히 자동화된 신경 재순서 매기기 간의 효과성은 어떻게 비교되는가?
  • RQ5다양한 문서 필드에서 융합 기반 키워드 검색(예: RRF)을 적용했을 때 검색 품질에 어떤 영향을 미치는가?

주요 결과

  • TREC-COVID 라운드 3에서 저자들은 분류 기반 접근 방식을 활용한 유사도 피드백을 통해 모든 제출 중 최고 점수를 기록함.
  • monoT5-3B를 사용한 재순서 매기기 런은 완전히 자동화된 런 중 두 번째로 높은 점수를 기록하여 수동 조작 없이도 뛰어난 성능을 입증함.
  • 융합 기반 키워드 검색 런(r3.fusion1 및 r3.fusion2)는 강력한 기반 제안으로서, 라운드 2에서는 136개, 라운드 3에서는 79개의 제출에서 이들에 기반함.
  • duoT5 모델은 monoT5에 비해 약간 향상되었지만, 성능 향상 폭은 미미하여 더 깊은 신경망 아키텍처의 이점이 점진적임을 시사함.
  • ScispaCy를 통해 추출한 명시적 개체명을 활용한 쿼리 확장 기법은 기준 키워드 쿼리 대비 검색 효과성에 상당한 향상을 가져옴.
  • 오픈소스된 Anserini 융합 기반 제안은 여러 최고 성능 팀에 의해 채택되었으며, 라운드 2에서 최고 점수를 기록한 수동 런과 최고의 자동 런을 포함함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.