Skip to main content
QUICK REVIEW

[论文解读] VCSUM: A Versatile Chinese Meeting Summarization Dataset

Han Wu, Mingjie Zhan|arXiv (Cornell University)|May 9, 2023
Topic Modeling被引用 4
一句话总结

本论文提出 VCSum,一个大规模、多功能的中文会议摘要数据集,包含 239 场真实会议,总时长超过 230 小时,具备多粒度标注,包括主题切分、标题、分割摘要、整体摘要以及关键句子突出。该数据集支持多种摘要任务,如基于分割的摘要、多粒度摘要和检索-生成摘要,并通过预训练对话模型(如 ConvLM)建立了强大的基准性能。

ABSTRACT

Compared to news and chat summarization, the development of meeting summarization is hugely decelerated by the limited data. To this end, we introduce a versatile Chinese meeting summarization dataset, dubbed VCSum, consisting of 239 real-life meetings, with a total duration of over 230 hours. We claim our dataset is versatile because we provide the annotations of topic segmentation, headlines, segmentation summaries, overall meeting summaries, and salient sentences for each meeting transcript. As such, the dataset can adapt to various summarization tasks or methods, including segmentation-based summarization, multi-granularity summarization and retrieval-then-generate summarization. Our analysis confirms the effectiveness and robustness of VCSum. We also provide a set of benchmark models regarding different downstream summarization tasks on VCSum to facilitate further research. The dataset and code will be released at https://github.com/hahahawu/VCSum.

研究动机与目标

  • 为解决大规模、高质量中文会议摘要数据集稀缺的问题,该问题阻碍了会议摘要研究的进展。
  • 构建一个多功能数据集,支持多种摘要任务,包括基于分割的摘要、多粒度摘要和抽取-生成摘要。
  • 为评估摘要模型在真实中文会议转录文本上的表现,提供一个全面的基准。
  • 通过一个标注详尽、公开发布的数据集,推动未来在端到端、多模态和忠实性感知会议摘要方面的研究。

提出的方法

  • 数据集源自从中文视频分享平台收集的公开可用的真实会议视频,确保了真实性和多样性。
  • 每份会议转录文本均经过主题切分标注,以识别主题边界,支持基于分割的摘要任务。
  • 提供多粒度摘要:简短标题(5–20 个字)、详细分割摘要(100–150 字)和整体会议摘要(200–250 字)。
  • 标注者明确标出关键句子,以支持抽取式摘要和检索-生成方法。
  • 在 VCSum 上微调一个对话专用的预训练语言模型 ConvLM,以在多种摘要任务上建立基线性能。
  • 标注者接受培训并受到监控以确保一致性,敏感信息已匿名化,严格遵守伦理准则。

实验结果

研究问题

  • RQ1VCSum 在基于分割的会议摘要任务中作为基准的有效性如何?
  • RQ2多粒度摘要模型在真实中文会议数据上能否实现优异性能?
  • RQ3在使用 VCSum 中的关键句子突出时,检索-生成方法的表现如何?
  • RQ4当应用于长时长、非正式、多说话人会议转录文本时,摘要模型的主要错误模式是什么?
  • RQ5对话专用预训练在多大程度上能提升 VCSum 上的摘要性能?

主要发现

  • VCSum 包含 239 场真实中文会议,总时长超过 230 小时,平均每份转录文本含 14,000 多个词符,是目前中文领域最大的此类数据集。
  • 在 VCSum 上微调的 ConvLM 模型在基于分割和联合摘要任务上的表现与标准抽象式模型相当或更优,证明了对话专用预训练的优势。
  • 约 50% 的摘要错误源于输入截断导致的信息缺失,尤其是在整体摘要生成中,凸显了长上下文建模的挑战。
  • 约 20% 的错误源于检索-生成方法中检索内容的无关或冗余,表明检索质量有待提升。
  • 剩余 30% 的错误包括事实性错误和语法错误,表明生成忠实性和连贯性方面仍存在挑战。
  • 该数据集在伦理上构建完善,数据已匿名化,标注者获得公平报酬,并经过仔细筛选以避免不当或偏见内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。