Skip to main content
QUICK REVIEW

[论文解读] ODSum: New Benchmarks for Open Domain Multi-Document Summarization

Yijie Zhou, Kejian Shi|arXiv (Cornell University)|Sep 16, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本文提出了 ODSum,一个针对开放域多文档摘要(ODMDS)的新基准,解决了缺乏真实、查询驱动数据集的问题。它提出一种基于规则的方法,将现有的查询聚焦型多文档摘要数据集转换为 ODMDS 数据集,从而支持端到端检索-摘要流水线的评估。主要发现表明,大型语言模型(LLMs)因检索错误导致性能显著下降,凸显了检索质量与摘要效果之间的关键依赖关系,G-Eval 分析揭示了不同摘要模型之间存在显著差异。

ABSTRACT

Open-domain Multi-Document Summarization (ODMDS) is a critical tool for condensing vast arrays of documents into coherent, concise summaries. With a more inter-related document set, there does not necessarily exist a correct answer for the retrieval, making it hard to measure the retrieving performance. We propose a rule-based method to process query-based document summarization datasets into ODMDS datasets. Based on this method, we introduce a novel dataset, ODSum, a sophisticated case with its document index interdependent and often interrelated. We tackle ODMDS with the extit{retrieve-then-summarize} method, and the performance of a list of retrievers and summarizers is investigated. Through extensive experiments, we identify variances in evaluation metrics and provide insights into their reliability. We also found that LLMs suffer great performance loss from retrieving errors. We further experimented methods to improve the performance as well as investigate their robustness against imperfect retrieval. We will release our data and code at https://github.com/yale-nlp/ODSum.

研究动机与目标

  • 为解决开放域多文档摘要(ODMDS)缺乏真实、查询驱动基准的问题,这对现实世界的知识提取至关重要。
  • 克服以往 ODMDS 研究的局限性,如伪查询构建和次优的文档数据库设计。
  • 创建一个反映现实世界挑战的数据集:从大规模、大部分无关的文档集合中检索相关文档,并对其进行连贯的摘要。
  • 在真实 ODMDS 环境下评估多种检索器和摘要器的性能,特别是在检索不完美条件下的表现。
  • 为评估指标的可靠性以及基于 LLM 的摘要流水线的鲁棒性提供洞见。

提出的方法

  • 基于规则的数据转换流水线,通过从参考摘要中提取类似用户查询的内容,将现有的查询聚焦型多文档摘要数据集(SQuALITY 和 QMSum)转换为 ODMDS 兼容的数据集。
  • 生成的 ODSum 数据集包含相互关联的文档索引和真实用户信息需求,模拟真实世界的检索挑战。
  • 研究采用标准的检索-摘要流水线,其中检索模型首先从大规模语料库中识别相关文档,随后进行抽象式摘要生成。
  • 在基准上评估了多种检索模型(如密集检索器、BM25)和摘要模型(如微调的 BART、GPT-3.5 和 Llama 等 LLMs)。
  • 使用多种评估指标(包括 ROUGE、G-Eval 等)进行评估,以衡量抽取式和抽象式摘要的质量。
  • 通过引入受控的检索错误,开展鲁棒性分析,以研究其对摘要性能的影响。

实验结果

研究问题

  • RQ1检索模型的性能在多大程度上影响开放域多文档摘要中的下游摘要质量?
  • RQ2当基于 LLM 的摘要器接收到不完美或噪声的检索结果时,其性能会下降到何种程度?
  • RQ3在不同检索条件下,标准评估指标(如 ROUGE、G-Eval)在衡量摘要质量方面的可靠性如何?
  • RQ4改进的检索策略在多大程度上可以缓解基于 LLM 的摘要流水线中的性能下降?
  • RQ5当面对多样化且相互关联的文档集合时,不同摘要模型在鲁棒性和连贯性方面表现如何?

主要发现

  • 当检索结果不准确时,LLMs 面临显著的性能下降,表明检索质量与摘要质量之间存在强烈依赖关系。
  • G-Eval 揭示了不同模型之间摘要质量存在显著差异,表明评估指标的选择会严重影响对模型性能的判断。
  • 所提出的基于规则的方法成功地将现有 qMDS 数据集转换为具备真实用户查询和相互关联文档集的现实 ODMDS 基准。
  • 检索错误是端到端 ODMDS 流水线的主要瓶颈,即使轻微的检索失败也会导致摘要质量大幅下降。
  • 在检索不完美时,微调的抽象式模型(如 BART)在连贯性和事实一致性方面优于零样本 LLMs。
  • ODSum 基准揭示了当前评估实践中的关键缺陷,尤其是过度依赖 ROUGE 而未考虑事实正确性或连贯性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。