[论文解读] Multi-Task Self-Supervised Learning for Disfluency Detection
该论文提出了一种用于干扰检测的多任务自监督学习框架,通过两项自监督任务生成自动生成的伪训练数据:识别插入流利句子中的噪声词,以及区分原始句子与受损句子。该方法实现了最先进性能,在使用完整数据集训练时,Switchboard测试集上的错误率降低了21%,即使仅使用1%的人工标注数据,其性能也优于BERT。
Most existing approaches to disfluency detection heavily rely on human-annotated data, which is expensive to obtain in practice. To tackle the training data bottleneck, we investigate methods for combining multiple self-supervised tasks-i.e., supervised tasks where data can be collected without manual labeling. First, we construct large-scale pseudo training data by randomly adding or deleting words from unlabeled news data, and propose two self-supervised pre-training tasks: (i) tagging task to detect the added noisy words. (ii) sentence classification to distinguish original sentences from grammatically-incorrect sentences. We then combine these two tasks to jointly train a network. The pre-trained network is then fine-tuned using human-annotated disfluency detection training data. Experimental results on the commonly used English Switchboard test set show that our approach can achieve competitive performance compared to the previous systems (trained using the full dataset) by using less than 1% (1000 sentences) of the training data. Our method trained on the full dataset significantly outperforms previous methods, reducing the error by 21% on English Switchboard.
研究动机与目标
- 解决人工标注的干扰检测数据成本高且稀缺的问题。
- 探究自监督预训练是否能减少对昂贵人工标注的依赖。
- 设计能够捕捉句子级语法结构和干扰模式的自监督任务。
- 仅使用标准训练数据的一小部分,提升干扰检测性能。
- 在低资源设置下展示多任务自监督学习在自然语言处理中的有效性。
提出的方法
- 通过从无标签新闻句子中随机添加或删除词语,构建大规模伪训练数据。
- 提出一种标注任务,用于识别并移除干扰句子中插入的噪声词。
- 引入一种句子分类任务,以区分原始流利句子与语法错误的受损版本。
- 联合训练神经网络以同时学习两个自监督任务,从而获得鲁棒的句子表示。
- 在少量人工标注的干扰检测数据上微调预训练模型。
- 通过拼接隐藏表示,将预训练模型与BERT结合,以进一步提升性能。
实验结果
研究问题
- RQ1使用自动生成数据进行自监督预训练是否能提升干扰检测性能?
- RQ2强调语法正确性和流利度恢复的多任务自监督目标是否能增强模型泛化能力?
- RQ3当仅在标准人工标注训练数据的1%上进行微调时,该方法的有效性如何?
- RQ4在低数据环境下,所提出的自监督模型能否优于或补充BERT?
- RQ5将所提出的模型与BERT结合是否能进一步提升干扰检测性能?
主要发现
- 当在完整数据集上训练时,该方法在英语Switchboard测试集上将错误率降低了21%,显著优于先前方法。
- 仅使用1,000个人工标注句子(少于完整数据集的1%),该方法在F1分数上达到86.1%,超过BERT在相同低数据设置下的82.4%。
- 在完整数据集上,该模型达到90.2%的F1分数,与最佳报告结果持平,并优于先前的最先进方法。
- 自监督的标注任务和分类任务表现良好,F1分数分别达到80%和准确率97%,证实了其可学习性和实用性。
- 将所提出的模型与BERT结合可进一步提升性能,在完整数据集上达到91.4%的F1分数,在1,000条句子上达到87.8%的F1分数,表明其表示具有互补性。
- 该模型在非重复性干扰(70.8% F1)上的表现尤为出色,优于基线模型,表明其能更好地捕捉复杂结构模式,优于基于规则或随机初始化的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。