Skip to main content
QUICK REVIEW

[论文解读] LARD: Large-scale Artificial Disfluency Generation

T. Passali, T. Mavropoulos|arXiv (Cornell University)|Jan 13, 2022
Speech and dialogue systems被引用 7
一句话总结

本文提出LARD方法,利用NLP工具和规则生成技术,在流畅对话语料库基础上自动生成大规模、逼真的英语人工不流畅现象。该方法可生成多样化的不流畅类型(重复、替换、重启动),发布了一个包含96,000个样本的数据集,并在不流畅现象检测任务中表现优于Switchboard等现有数据集,尤其在罕见不流畅类型上优势显著。

ABSTRACT

Disfluency detection is a critical task in real-time dialogue systems. However, despite its importance, it remains a relatively unexplored field, mainly due to the lack of appropriate datasets. At the same time, existing datasets suffer from various issues, including class imbalance issues, which can significantly affect the performance of the model on rare classes, as it is demonstrated in this paper. To this end, we propose LARD, a method for generating complex and realistic artificial disfluencies with little effort. The proposed method can handle three of the most common types of disfluencies: repetitions, replacements and restarts. In addition, we release a new large-scale dataset with disfluencies that can be used on four different tasks: disfluency detection, classification, extraction and correction. Experimental results on the LARD dataset demonstrate that the data produced by the proposed method can be effectively used for detecting and removing disfluencies, while also addressing limitations of existing datasets.

研究动机与目标

  • 为解决口语中不流畅现象检测任务缺乏大规模、多样化且平衡的数据集的问题。
  • 克服现有数据集中类别不平衡的问题,特别是简单重复类型过度代表的问题。
  • 开发一种自动化、可扩展的方法,从流畅文本中生成复杂、连贯且逼真的不流畅现象。
  • 发布一个新的大规模数据集(LARD),支持四项任务:检测、分类、抽取和纠正。
  • 证明在LARD数据集上微调的模型优于在不平衡数据集(如Switchboard)上训练的模型,尤其在罕见不流畅类型上表现更优。

提出的方法

  • 该方法以一个已有的大规模对话语料库(SGD)为基础,该语料库仅包含流畅的语句。
  • 应用先进的NLP工具(如词性标注器、依存句法分析器)对输入文本进行分析与结构化处理,以支持不流畅现象的插入。
  • 通过规则模板生成三类主要类型的不流畅现象:重复、替换和重启动。
  • 通过上下文感知的插入策略,确保生成过程保持句法和语义上的合理性,从而保证语言连贯性。
  • 该流程设计旨在在最小化人工干预的前提下,实现高度的多样性与真实性。
  • 最终数据集包含约96,000个不流畅样本,各类不流畅现象分布均衡。

实验结果

研究问题

  • RQ1合成不流畅现象生成能否产生反映自然人类口语复杂性的逼真、多样且连贯的不流畅现象?
  • RQ2与类别不平衡的真实数据集相比,大规模、平衡的合成数据集是否能提升不流畅现象检测与纠正任务的模型性能?
  • RQ3在LARD数据集上微调的模型能否在多个不流畅现象相关任务(检测、分类、抽取、纠正)中有效泛化?
  • RQ4在LARD上训练的模型与在Switchboard等现有数据集上训练的模型相比,尤其在罕见不流畅类型上的表现如何?
  • RQ5通过LARD进行数据增强在多大程度上缓解了不流畅现象检测中类别不平衡带来的负面影响?

主要发现

  • 在LARD数据集上微调的模型在不流畅现象检测任务中达到97.62%的F1分数,显著优于在Switchboard上训练的模型。
  • 在最罕见的不流畅类型——重启动中,LARD训练的模型准确率达到95.08%,而Switchboard上仅为19.6%。
  • 对于替换类不流畅现象,基于LARD的模型准确率达到99.67%,而Switchboard上仅为54.52%。
  • 在不流畅现象纠正任务中,LARD数据集上的BLEU分数达到86.48,而Switchboard上为71.49。
  • LARD数据集在所有四项任务(检测、分类、抽取和纠正)中均表现出更优性能。
  • 本研究证实,现有数据集(如Switchboard)中的数据不平衡严重限制了模型的泛化能力,尤其对非重复类不流畅现象影响显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。