Skip to main content
QUICK REVIEW

[论文解读] Investigating the role of L1 in automatic pronunciation evaluation of L2 speech

Ming Tu, Anna Grabek|arXiv (Cornell University)|Jul 4, 2018
Speech Recognition and Synthesis参考文献 14被引用 6
一句话总结

本文提出了一种新颖的自动发音评估系统,通过结合L1和L2语音模型来提升口音程度的预测能力。通过从L1和L2模型中提取音素级别的置信度分数,并将其组合为固定维度的发音级别特征向量,该方法在四种L1背景(中文、西班牙语、德语、法语)下均实现了与人类评分更高的相关性,即使人类评估者不了解说话者的L1,也表现出一致的性能提升。

ABSTRACT

Automatic pronunciation evaluation plays an important role in pronunciation training and second language education. This field draws heavily on concepts from automatic speech recognition (ASR) to quantify how close the pronunciation of non-native speech is to native-like pronunciation. However, it is known that the formation of accent is related to pronunciation patterns of both the target language (L2) and the speaker's first language (L1). In this paper, we propose to use two native speech acoustic models, one trained on L2 speech and the other trained on L1 speech. We develop two sets of measurements that can be extracted from two acoustic models given accented speech. A new utterance-level feature extraction scheme is used to convert these measurements into a fixed-dimension vector which is used as an input to a statistical model to predict the accentedness of a speaker. On a data set consisting of speakers from 4 different L1 backgrounds, we show that the proposed system yields improved correlation with human evaluators compared to systems only using the L2 acoustic model.

研究动机与目标

  • 探究在L2语音的自动发音评估中引入L1语音模型是否能带来性能提升。
  • 解决现有系统仅依赖L2语音模型的局限性,这些系统可能忽略由L1影响引起的发音偏差。
  • 开发一种特征提取方案,将L1和L2模型的置信度分数结合,以提升口音程度预测能力。
  • 在包含四种L1背景(中文、西班牙语、德语、法语)的多语言数据集上进行评估,该数据集包含人工标注的口音程度分数。
  • 确定当人类评分者不了解说话者L1时,L1相关特征是否仍能提升模型性能。

提出的方法

  • 提取两组音素级别的置信度分数:一组来自L2语音模型(PS_L2),另一组来自L1语音模型(PS_L1),利用L2模型的强制对齐结果获得。
  • PS_L1分数衡量非母语L2发音与说话者L1中最接近音素的匹配程度,捕捉L1迁移效应。
  • 提出一种发音级别特征提取方案,将音素级别的置信度分数聚合为固定维度的向量,供统计模型使用。
  • 训练线性回归模型,利用结合后的PS_L2和PS_L1特征预测人工标注的口音程度分数。
  • 采用留一说话者交叉验证的方式,在GMU语音口音档案库的一个子集上评估系统,每位说话者有13名人类评分者参与。
  • 性能通过皮尔逊相关系数(PCC)和平均绝对误差(MAE)进行衡量,并对德语和法语说话者组进行下采样以实现数据平衡。
Figure 2: System diagram.
Figure 2: System diagram.

实验结果

研究问题

  • RQ1在仅使用L2语音模型的基础上,引入L1语音模型特征是否能进一步提升自动发音评估性能?
  • RQ2在多种L1背景下,L1相关特征的引入是否能带来与人工标注口音程度分数更高的相关性?
  • RQ3当人类评分者不了解说话者L1时,L1特征带来的性能增益是否依然稳定?
  • RQ4L1特征的贡献在不同L1之间是否存在差异?其性能差异的潜在解释因素是什么?
  • RQ5该框架能否有效区分L1特定与L1无关的第二语言发音错误?

主要发现

  • 在所有四种L1中,采用PS_L2和PS_L1特征的系统均获得了比仅使用PS_L2的基线模型更高的皮尔逊相关系数(PCC):中文(0.727 vs. 0.707)、西班牙语(0.730 vs. 0.681)、德语(0.833 vs. 0.751)、法语(0.556 vs. 0.371)。
  • 在所有L1组中,加入PS_L1特征后,平均绝对误差(MAE)均有所降低,表明预测精度得到提升。
  • 尽管德语和法语组的基线性能较低,但PS_L1特征带来的性能增益在所有四种L1中均保持一致。
  • 通过对德语和法语说话者组进行下采样以实现更均衡的标签分布,模型性能得到改善,表明标签分布会影响模型学习效果。
  • 结果表明,即使人类评分者不了解说话者的L1背景,L1语音模型仍能提供有意义且互补的信息,有助于口音程度预测。
  • 本研究证明,L1相关特征可有效提升自动发音评估性能,支持了L1迁移在L2发音偏差中起重要作用的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。