Skip to main content
QUICK REVIEW

[论文解读] Predicting Prosodic Prominence from Text with Pre-trained Contextualized Word Representations

Aarne Talman, Antti Suni|arXiv (Cornell University)|Aug 6, 2019
Natural Language Processing Techniques参考文献 22被引用 7
一句话总结

本文引入了一个大规模、公开可用的数据集,包含280万个词,其语调突出性标签由LibriTTS语料库自动生成,实现了从文本预测语调突出性的目标。利用该基准,作者表明,即使仅使用10%的训练数据,基于BERT的模型也显著优于传统特征方法和BiLSTM模型,凸显了预训练上下文表示在语调预测中的价值。

ABSTRACT

In this paper we introduce a new natural language processing dataset and benchmark for predicting prosodic prominence from written text. To our knowledge this will be the largest publicly available dataset with prosodic labels. We describe the dataset construction and the resulting benchmark dataset in detail and train a number of different models ranging from feature-based classifiers to neural network systems for the prediction of discretized prosodic prominence. We show that pre-trained contextualized word representations from BERT outperform the other models even with less than 10% of the training data. Finally we discuss the dataset in light of the results and point to future research and plans for further improving both the dataset and methods of predicting prosodic prominence from text. The dataset and the code for the models are publicly available.

研究动机与目标

  • 为解决缺乏大规模、公开可用的从文本预测语调突出性的数据集的问题。
  • 开发并基准测试序列标注模型,以从书面文本预测离散的语调突出性等级。
  • 评估预训练上下文表示(如BERT)在此任务中相对于传统模型的有效性。
  • 识别自动标注中的局限性及模型性能问题,并为未来提升数据质量和建模方法提供指导。

提出的方法

  • 从LibriTTS语料库构建了一个包含280万个词的基准数据集,使用基于连续小波变换的方法自动生成语调突出性标签。
  • 将语调突出性预测视为序列标注任务,为每个词分配一个离散的突出性标签(0:非突出,1:中等突出,2:高度突出)。
  • 在该数据集上训练并比较多种模型,包括基于特征的分类器、BiLSTM以及基于BERT的模型。
  • 在数据集上微调BERT,并使用标准指标评估性能,比较不同训练数据规模下的结果。
  • 分析模型错误,并评估数据分布、语体和说话人差异对模型性能的影响。
  • 探索未来改进的潜力,包括说话人感知建模、语体适应以及扩展上下文建模。

实验结果

研究问题

  • RQ1即使训练数据有限,像BERT这样的预训练上下文表示是否能有效从文本预测语调突出性?
  • RQ2BERT在预测语调突出性方面与传统模型(如BiLSTM和手工特征分类器)相比表现如何?
  • RQ3自动突出性标注中的主要错误来源是什么,它们如何影响模型的泛化能力?
  • RQ4语料特征(如语体多样性、说话人差异和预训练分布)如何影响模型性能?
  • RQ5在大规模文本语料上进行预训练,能在多大程度上迁移有用的句法和语义特征用于语调预测?

主要发现

  • BERT在所有突出性标签上均显著优于BiLSTM和基于特征的分类器,即使仅使用10%的训练数据。
  • 在当代新闻语料(波士顿大学广播新闻)上的性能差距明显大于在基于LibriTTS的测试集上,表明存在领域偏移效应。
  • 仅使用10%的训练数据,BERT的性能就优于其他模型在完整数据集上训练的结果,表明预训练带来的归纳偏置非常强。
  • LibriTTS语料中的说话人间差异和语体多样性被识别为影响模型泛化能力和测试性能的关键负面因素。
  • 手动校正测试集标注和采用说话人特定建模可提升结果,但当前自动标注质量仍是主要限制因素。
  • 结果表明,大规模文本语料上的预训练隐式捕捉了与语调突出性相关的句法和语义特征,支持后续通过任务特定特征(如词性标注)进行微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。