[论文解读] DORIS-MAE: Scientific Document Retrieval using Multi-level Aspect-based Queries
DORIS-MAE 提出了一项新颖的科学文献检索任务,采用多层次基于方面(aspect-based)的查询来处理复杂、多方面的研究问题。该研究构建了一个由人工标注的 100 个复杂查询组成的高质量数据集,涵盖计算机科学领域,每个查询均配有 100 篇相关摘要及分层的方面/子方面结构,支持超过 4,000 个子查询测试用例。通过基于大语言模型的标注方法(Anno-GPT),实现 500 倍的成本降低,同时保持了质量无损。实验揭示了现有检索模型在复杂查询上的显著性能下降,凸显了对更鲁棒方法的迫切需求。
In scientific research, the ability to effectively retrieve relevant documents based on complex, multifaceted queries is critical. Existing evaluation datasets for this task are limited, primarily due to the high cost and effort required to annotate resources that effectively represent complex queries. To address this, we propose a novel task, Scientific DOcument Retrieval using Multi-level Aspect-based quEries (DORIS-MAE), which is designed to handle the complex nature of user queries in scientific research. We developed a benchmark dataset within the field of computer science, consisting of 100 human-authored complex query cases. For each complex query, we assembled a collection of 100 relevant documents and produced annotated relevance scores for ranking them. Recognizing the significant labor of expert annotation, we also introduce Anno-GPT, a scalable framework for validating the performance of Large Language Models (LLMs) on expert-level dataset annotation tasks. LLM annotation of the DORIS-MAE dataset resulted in a 500x reduction in cost, without compromising quality. Furthermore, due to the multi-tiered structure of these complex queries, the DORIS-MAE dataset can be extended to over 4,000 sub-query test cases without requiring additional annotation. We evaluated 17 recent retrieval methods on DORIS-MAE, observing notable performance drops compared to traditional datasets. This highlights the need for better approaches to handle complex, multifaceted queries in scientific research. Our dataset and codebase are available at https://github.com/Real-Doris-Mae/Doris-Mae-Dataset.
研究动机与目标
- 为解决科学文献检索领域中缺乏高质量、复杂查询基准的问题。
- 设计一种分层的、基于方面的查询结构,以提升标注效率与检索模型的可解释性。
- 通过可扩展的大语言模型验证框架(Anno-GPT),降低专家级标注的成本。
- 评估现有检索模型在复杂、多意图查询上的表现,并揭示其局限性。
- 在无需额外标注的前提下,从 100 个原始查询中生成超过 4,000 个子查询测试用例。
提出的方法
- DORIS-MAE 任务将复杂的科学查询结构化为分层的方面与子方面,以捕捉多维度的研究问题。
- 由专家人工构建了包含 100 个复杂查询的基准数据集,每个查询均配有一组来自 arXiv(2011–2021)的 100 篇相关计算机科学摘要。
- 人类专家对每个(方面/子方面,摘要)配对进行了相关性评分,形成包含 83,591 对的排序测试集。
- Anno-GPT 是一种利用统计方法验证大语言模型生成标注的流水线,确保其质量与人类专家相当。
- 使用大语言模型(ChatGPT-3.5-turbo)生成标注,与完全人工标注相比,将标注成本降低了 500 倍。
- 分层结构支持在无需新增标注的情况下,自动扩展生成超过 4,000 个子查询测试用例。

实验结果
研究问题
- RQ1分层的、基于方面的查询结构能否提升科学文献检索的准确率与可扩展性?
- RQ2大语言模型在标注复杂、专家级文献相关性方面,能在多大程度上替代人类专家?
- RQ3现有检索模型在复杂、多意图查询上的表现,与传统基准相比如何?
- RQ4是否可以利用查询的分层结构,在无需额外标注的情况下生成大量子查询测试用例?
- RQ5在科学检索数据集中,使用大语言模型进行专家级标注的代价-质量权衡如何?
主要发现
- DORIS-MAE 数据集包含 100 个复杂查询,每个查询配有 100 篇相关摘要,共形成 83,591 个标注的(方面/子方面,摘要)配对。
- 通过 Anno-GPT 实现的大语言模型标注在质量上与人类专家相当,同时将标注成本降低了 500 倍。
- 分层方面结构使得在无需额外标注的情况下,从原始 100 个查询中自动生成超过 4,000 个子查询测试用例成为可能。
- 在 DORIS-MAE 上评估时,17 个近期检索模型的表现相比传统基准出现显著下降,表明其在复杂查询上的局限性。
- 该数据集为自包含、公开发布,采用 CC-BY-NC 许可,托管于 GitHub 与 Zenodo,DOI 为 10.5281/zenodo.8035110。
- 该数据集由作者维护,将通过 DOI 版本控制机制持续更新以修正错误。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。