Skip to main content
QUICK REVIEW

[论文解读] A Sliding-Window Approach to Automatic Creation of Meeting Minutes

Jia Jin Koay, Alexander Roustai|arXiv (Cornell University)|Apr 26, 2021
Topic Modeling参考文献 38被引用 4
一句话总结

本文提出一种基于滑动窗口的生成方法,利用微调后的 BART 摘要模型,从语音转录文本中自动生成会议纪要。通过在重叠窗口内处理转录文本并提取关键内容,该方法在人工转录和自动转录上均表现出色,优于基线方法,在抽取式摘要任务中表现优异,并生成了连贯、具备上下文感知能力的摘要,且无需使用标注训练数据。

ABSTRACT

Meeting minutes record any subject matters discussed, decisions reached and actions taken at meetings. The importance of minuting cannot be overemphasized in a time when a significant number of meetings take place in the virtual space. In this paper, we present a sliding window approach to automatic generation of meeting minutes. It aims to tackle issues associated with the nature of spoken text, including lengthy transcripts and lack of document structure, which make it difficult to identify salient content to be included in the meeting minutes. Our approach combines a sliding window and a neural abstractive summarizer to navigate through the transcripts to find salient content. The approach is evaluated on transcripts of natural meeting conversations, where we compare results obtained for human transcripts and two versions of automatic transcripts and discuss how and to what extent the summarizer succeeds at capturing salient content.

研究动机与目标

  • 解决从虚拟会议中常见的长篇、非结构化语音转录文本中生成准确会议纪要的挑战。
  • 克服神经网络抽象式摘要模型在应用于语音会议数据时存在的位置偏差和上下文长度限制等局限性。
  • 评估滑动窗口策略在识别不同类型转录文本(包括人工转录和自动转录)中关键内容方面的有效性。
  • 从自动评估和人工评估指标两方面,将所提方法与抽取式和有监督抽象式基线方法进行比较。

提出的方法

  • 该方法在会议转录文本上应用滑动窗口,窗口大小(W)和步长(S)可配置,以处理转录文本的局部片段。
  • 对于每个窗口,使用微调后的 BART-large-cnn 模型生成该局部内容的抽象式摘要,识别关键话语。
  • 通过使用重叠窗口确保关键内容不会因窗口边界而被遗漏,窗口大小和步长经过调优以实现最佳召回率与精确率平衡。
  • 通过合并并去重各窗口中选出的话语,将局部摘要整合为最终的会议级摘要。
  • 该系统在 ICSI 会议语料库的转录文本上进行评估,包括人工转录以及来自 AMI ASR 和 Google Cloud Speech-to-Text 的两种自动转录版本。
  • 该方法无需任何标注训练数据,因此可灵活适配多种会议领域和类型。

实验结果

研究问题

  • RQ1在语音会议转录文本中,实现有效关键性检测的最优窗口大小和步长是多少?
  • RQ2神经网络抽象式摘要模型能否有效识别语音转录文本局部窗口中的关键内容?
  • RQ3如何将重叠窗口中生成的局部摘要整合为连贯、高质量的会议级摘要?
  • RQ4从自动评估和人工评估角度看,滑动窗口方法与抽取式和有监督抽象式基线方法相比表现如何?

主要发现

  • 当窗口大小 W=1024、步长 S=128 时,滑动窗口方法在训练集上达到最高的 F1 分数(0.455),在精确率与召回率之间达到最佳平衡。
  • 较小的窗口和步长(W=128,S=128)虽带来较高的召回率(每场会议约 30% 的话语被选中),但精确率较低;而更大的窗口则提升了精确率。
  • 在人工评估中,该方法优于 TextRank,且与有监督 BERT 摘要模型表现相当,67% 的话语被评为高度相关或相关。
  • 与有监督 BERT 模型相比,滑动窗口生成的摘要在连贯性和上下文连贯性方面更优,相邻话语更可能由同一说话人说出或围绕同一主题。
  • Google Cloud Speech-to-Text 生成的转录文本在话语分割行为上与人工转录和 AMI ASR 转录不同,影响了摘要的一致性。
  • 该方法通过在重叠窗口中处理,成功处理了超过 BART 输入长度限制的转录文本,实现了无需截断的端到端摘要生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。