Skip to main content
QUICK REVIEW

[논문 리뷰] DORIS-MAE: Scientific Document Retrieval using Multi-level Aspect-based Queries

Jianyou Wang, Kaicheng Wang|arXiv (Cornell University)|2023. 10. 07.
Topic ModelingComputer Science인용 수 3
한 줄 요약

DORIS-MAE는 복잡하고 다면적인 연구 질문을 다루기 위해 다수 수준의 요소 기반 쿼리를 사용하는 새로운 과학문서 검색 작업을 제안한다. 컴퓨터 과학 분야의 100개의 복잡한 쿼리로 구성된 인간 레이블링된 데이터셋을 제안하며, 각 쿼리당 100개의 관련 초록과 계층적인 요소/부요소 구조를 포함하여 4,000개 이상의 하위쿼리 테스트 케이스를 가능하게 한다. LLM 기반 레이블링(Anno-GPT)을 통해 비용을 500배 감소시켰지만 품질 손실 없이 구현하였으며, 기존 검색 모델의 성능 저하가 심각하게 드러나 더 견고한 방법의 필요성을 시사한다.

ABSTRACT

In scientific research, the ability to effectively retrieve relevant documents based on complex, multifaceted queries is critical. Existing evaluation datasets for this task are limited, primarily due to the high cost and effort required to annotate resources that effectively represent complex queries. To address this, we propose a novel task, Scientific DOcument Retrieval using Multi-level Aspect-based quEries (DORIS-MAE), which is designed to handle the complex nature of user queries in scientific research. We developed a benchmark dataset within the field of computer science, consisting of 100 human-authored complex query cases. For each complex query, we assembled a collection of 100 relevant documents and produced annotated relevance scores for ranking them. Recognizing the significant labor of expert annotation, we also introduce Anno-GPT, a scalable framework for validating the performance of Large Language Models (LLMs) on expert-level dataset annotation tasks. LLM annotation of the DORIS-MAE dataset resulted in a 500x reduction in cost, without compromising quality. Furthermore, due to the multi-tiered structure of these complex queries, the DORIS-MAE dataset can be extended to over 4,000 sub-query test cases without requiring additional annotation. We evaluated 17 recent retrieval methods on DORIS-MAE, observing notable performance drops compared to traditional datasets. This highlights the need for better approaches to handle complex, multifaceted queries in scientific research. Our dataset and codebase are available at https://github.com/Real-Doris-Mae/Doris-Mae-Dataset.

연구 동기 및 목표

  • 과학문서 검색 분야에서 고품질의 복잡한 쿼리 벤치마크가 부족한 문제를 해결하기 위해.
  • 레이블링 효율성 향상과 검색 모델의 해석 가능성 향상을 위해 계층적 요소 기반 쿼리 구조를 설계하기 위해.
  • 확장 가능한 LLM 검증 프레임워크(Anno-GPT)를 통해 전문가 수준의 레이블링 비용을 감소시키기 위해.
  • 기존 검색 모델이 복잡하고 다중 의도를 가진 쿼리에서 어떻게 성능을 발휘하는지 평가하고 그 한계를 드러내기 위해.
  • 추가 레이블링 없이 100개의 원본 쿼리에서 4,000개 이상의 하위쿼리 테스트 케이스를 생성할 수 있도록 하기 위해.

제안 방법

  • DORIS-MAE 작업은 복잡한 과학적 쿼리를 다층적인 요소와 부요소로 분해하여 다면적인 연구 질문을 포괄하도록 구성한다.
  • 전문가들이 수작업으로 100개의 복잡한 쿼리 벤치마크 데이터셋을 제작하였으며, 각 쿼리당 arXiv(2011–2021)에서 추출한 100개의 관련 컴퓨터 과학 초록과 연결되었다.
  • 각 (요소/부요소, 초록) 쌍에 대한 관련성 점수는 인간 전문가가 레이블링하여 총 83,591개의 순위 매겨진 테스트 쌍을 구성하였다.
  • Anno-GPT는 통계적 방법을 사용해 LLM이 생성한 레이블의 품질을 검증하는 파이프라인으로, 인간 전문가 수준의 품질을 확보한다.
  • LLM(ChatGPT-3.5-turbo)을 사용해 레이블링을 수행하여 전면 인간 레이블링 대비 비용을 500배 감소시켰다.
  • 계층적 구조 덕분에 추가 레이블링 없이도 테스트 케이스를 자동으로 4,000개 이상의 하위쿼리로 확장할 수 있었다.
Figure 1: Example from the DORIS-MAE dataset. Each query is broken down into aspects and sub-aspects. Aspects are semantically distinct components of the query, and sub-aspects are minimal requirements that can be extracted from the aspects.
Figure 1: Example from the DORIS-MAE dataset. Each query is broken down into aspects and sub-aspects. Aspects are semantically distinct components of the query, and sub-aspects are minimal requirements that can be extracted from the aspects.

실험 결과

연구 질문

  • RQ1계층적 요소 기반 쿼리 구조는 과학문서 검색의 정확성과 확장성 향상에 기여하는가?
  • RQ2LLM은 복잡하고 전문가 수준의 문서 관련성 레이블링에서 인간 전문가를 얼마나 대체할 수 있는가?
  • RQ3기존 검색 모델은 전통적 벤치마크와 비교해 복잡하고 다중 의도를 가진 쿼리에서 어떻게 성능을 발휘하는가?
  • RQ4쿼리의 계층적 구조를 활용해 추가 레이블링 없이도 대량의 하위쿼리 테스트 케이스를 생성할 수 있는가?
  • RQ5과학문서 검색 데이터셋에서 전문가 수준의 레이블링에 LLM을 사용할 경우의 비용-품질 트레이드오프는 어떠한가?

주요 결과

  • DORIS-MAE 데이터셋은 100개의 복잡한 쿼리로 구성되며, 각 쿼리당 100개의 관련 초록을 포함하여 총 83,591개의 (요소/부요소, 초록) 쌍으로 구성된 레이블이 있다.
  • Anno-GPT를 통한 LLM 기반 레이블링은 인간 전문가 수준의 품질을 확보하였으며, 레이블링 비용을 500배 감소시켰다.
  • 계층적 요소 구조 덕분에 추가 레이블링 없이도 원본 100개의 쿼리에서 4,000개 이상의 하위쿼리 테스트 케이스를 생성할 수 있었다.
  • DORIS-MAE에서 평가한 17개의 최신 검색 모델은 기존 벤치마크 대비 성능 저하를 보였으며, 이는 복잡한 쿼리에서의 한계를 시사한다.
  • 데이터셋은 자가 포함되어 있으며, CC-BY-NC 라이선스 하에 공개되었으며, GitHub와 Zenodo에 배포되었으며, DOI 10.5281/zenodo.8035110를 통해 접근할 수 있다.
  • 데이터셋은 저자들이 유지 관리하며 오류 수정을 위해 업데이트될 것이며, DOIs를 통해 버전 관리가 유지된다.
(a) Normalized scores of abstracts in candidate pool per query.
(a) Normalized scores of abstracts in candidate pool per query.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.