Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Abstractive Meeting Summarization with Multi-Sentence Compression and Budgeted Submodular Maximization

Guokan Shang, Wensi Ding|arXiv (Cornell University)|May 14, 2018
Topic Modeling参考文献 15被引用 16
一句话总结

本文提出了一种完全无监督的生成式会议摘要框架,结合多句压缩与预算子模最大化,从嘈杂的自动语音识别(ASR)转录文本中生成流畅且信息丰富的摘要。通过利用基于图退化性的词重要性评分和一种新颖的路径重排序策略,该方法在无需任何标注训练数据或语言特定调优的情况下,在AMI和ICSI数据集上实现了最先进(SOTA)的ROUGE得分。

ABSTRACT

We introduce a novel graph-based framework for abstractive meeting speech summarization that is fully unsupervised and does not rely on any annotations. Our work combines the strengths of multiple recent approaches while addressing their weaknesses. Moreover, we leverage recent advances in word embeddings and graph degeneracy applied to NLP to take exterior semantic knowledge into account, and to design custom diversity and informativeness measures. Experiments on the AMI and ICSI corpus show that our system improves on the state-of-the-art. Code and data are publicly available, and our system can be interactively tested.

研究动机与目标

  • 开发一种完全无监督的生成式会议语音摘要框架,不依赖任何标注训练数据或语言特定资源。
  • 通过基于图的冗余建模将鲁棒性整合到摘要生成流程中,以应对嘈杂且不合语法的ASR转录文本带来的挑战。
  • 通过结合图退化度量与语言模型约束,提升生成摘要的信息量与语法正确性。
  • 通过最小化对语言特定组件的依赖(除基本自然语言处理工具外),实现跨语言适用性。

提出的方法

  • 使用滑动窗口从会议话语中构建词共现图,以建模语义关系。
  • 应用图退化性(核心数)识别关键词,替代PageRank以实现更优的关键信息检测与更强的抗噪能力。
  • 将多句压缩图(MSCG)扩展为自定义路径重排序函数,结合核心数得分与语言模型概率,优先选择语法正确且信息丰富的路径。
  • 利用社区检测按主题对话语进行分组,支持按社区生成生成式句子。
  • 应用预算子模最大化,在长度约束下选择最优的生成式句子集合,以优化多样性与信息量。
  • 使用语言模型评估路径流畅性,使用词性标注器过滤非内容词,从而提升摘要质量。

实验结果

研究问题

  • RQ1完全无监督的框架是否能在不使用任何标注训练数据的情况下,实现生成式会议摘要的最先进性能?
  • RQ2基于图退化性的词重要性度量在识别摘要所需信息内容方面,相较于传统PageRank有何改进?
  • RQ3在存在嘈杂、碎片化ASR转录文本的情况下,多句压缩结合子模选择在多大程度上能生成流畅且多样化的生成式摘要?
  • RQ4语言模型得分与基于核心数的重排序相结合,对摘要流畅性与信息量的影响如何?

主要发现

  • 所提系统在AMI数据集上生成350词摘要时,ROUGE-1 F1得分达到41.14,在ICSI数据集上达到36.05,优于所有基线模型,包括Oracle模型。
  • 在ICSI数据集上,该系统在所有非Oracle系统中取得最高的ROUGE-1 F1(36.05)与ROUGE-SU4(4.82)得分,表明其在更具挑战性的多摘要匹配基准上表现强劲。
  • 采用FluCovRank重排序的系统相比基线模型,ROUGE-2 F1提升0.59分,证实流畅性建模可有效提升摘要质量。
  • 该系统在不同摘要长度下保持一致的性能表现,表明其对预算超参数具有鲁棒性,尽管针对特定长度进行了调优。
  • 即使与可访问抽取式人工摘要的Oracle模型相比,该方法仍取得具有竞争力的结果,凸显其在捕捉生成式内容方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。