Skip to main content
QUICK REVIEW

[论文解读] CQSumDP: A ChatGPT-Annotated Resource for Query-Focused Abstractive Summarization Based on Debatepedia

Md Tahmid Rahman Laskar, Mizanur Rahman|arXiv (Cornell University)|Mar 31, 2023
Topic Modeling被引用 5
一句话总结

本文提出 CQSumDP,即对 Debatepedia 数据集进行清洗并添加查询注释的版本,用于查询聚焦的抽象摘要任务,利用 ChatGPT 重新生成无关或低质量的查询。所生成的数据集在查询相关性和摘要质量方面均优于原始数据集,表明基于大语言模型的数据清洗能显著提升摘要任务的基准性能。

ABSTRACT

Debatepedia is a publicly available dataset consisting of arguments and counter-arguments on controversial topics that has been widely used for the single-document query-focused abstractive summarization task in recent years. However, it has been recently found that this dataset is limited by noise and even most queries in this dataset do not have any relevance to the respective document. In this paper, we present a methodology for cleaning the Debatepedia dataset by leveraging the generative power of large language models to make it suitable for query-focused abstractive summarization. More specifically, we harness the language generation capabilities of ChatGPT to regenerate its queries. We evaluate the effectiveness of the proposed ChatGPT annotated version of the Debatepedia dataset using several benchmark summarization models and demonstrate that the newly annotated version of Debatepedia outperforms the original dataset in terms of both query relevance as well as summary generation quality. We will make this annotated and cleaned version of the dataset publicly available.

研究动机与目标

  • 为广泛使用的 Debatepedia 数据集在查询聚焦的抽象摘要任务中所存在的噪声大、无关查询这一关键问题提供解决方案。
  • 开发一种可扩展、低成本的方法,利用大语言模型而非人工标注来提升数据集质量。
  • 创建一个公开可用的高质量基准数据集,以增强摘要模型的训练与评估效果。
  • 验证大语言模型生成的查询是否能带来在查询相关性和摘要质量方面的性能提升。

提出的方法

  • 利用 ChatGPT 的生成能力,对 Debatepedia 数据集中每个文档-摘要对重新生成查询。
  • 采用基于提示的方法,指导 ChatGPT 生成与原文内容和参考摘要均相关的查询。
  • 实施过滤与验证流程,确保生成的查询在语义上与源内容和摘要保持一致。
  • 使用 BART-Large 在原始数据集和 CQSumDP 数据集上进行零样本评估,以比较模型性能。
  • 对样本查询进行定性分析,比较原始查询与 ChatGPT 生成查询在相关性和连贯性方面的差异。
  • 将清洗并注释后的 CQSumDP 数据集公开发布,以支持未来研究。

实验结果

研究问题

  • RQ1像 ChatGPT 这类大语言模型能否有效重生成查询,以提升现有噪声较大的摘要数据集的质量?
  • RQ2与原始查询相比,使用大语言模型生成的查询是否能在查询相关性和摘要质量方面带来可测量的改进?
  • RQ3当在清洗后的 CQSumDP 数据集与原始 Debatepedia 数据集上进行微调或评估时,标准抽象摘要模型(如 BART-Large)的性能表现有何差异?
  • RQ4与人工标注相比,使用 ChatGPT 进行数据标注在 NLP 基准构建中能否显著降低时间和成本?
  • RQ5CQSumDP 数据集能否作为未来查询聚焦抽象摘要研究中可靠且有效的基准?

主要发现

  • 在多个基准模型上,CQSumDP 数据集均在查询相关性和摘要生成质量方面优于原始 Debatepedia 数据集。
  • 对 BART-Large 在 CQSumDP 上的零样本评估显示,其性能优于在原始数据集上的表现,证实了数据质量的提升。
  • 定性分析表明,ChatGPT 生成的查询在描述性、相关性和连贯性方面显著优于原始的一词或无关主题的查询。
  • 使用 ChatGPT 生成平均查询的速度约为每分钟 4 个样本,相比人工标注展现出更高的效率。
  • 与基于人工的标注相比,使用 ChatGPT 进行数据标注在成本和时间效率方面显著更高,尤其考虑到 ChatGPT 的免费访问。
  • 本研究证实,基于大语言模型的数据清洗是一种可行、可扩展且有效的改进现有 NLP 数据集的方法,尤其适用于摘要任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。