[论文解读] A Full Text-Dependent End to End Mispronunciation Detection and Diagnosis with Easy Data Augmentation Techniques
本论文提出一个利用先前音素序列并结合注意力机制的文本依赖端到端MD&D模型,以及三种简单的数据增强方法来解决类别不平衡,在TIMIT和L2-ARCTIC上相对于CNN-RNN-CTC基线在F-measure和PER方面有所提升。
Recently, end-to-end mispronunciation detection and diagnosis (MD&D) systems has become a popular alternative to greatly simplify the model-building process of conventional hybrid DNN-HMM systems by representing complicated modules with a single deep network architecture. In this paper, in order to utilize the prior text in the end-to-end structure, we present a novel text-dependent model which is difference with sed-mdd, the model achieves a fully end-to-end system by aligning the audio with the phoneme sequences of the prior text inside the model through the attention mechanism. Moreover, the prior text as input will be a problem of imbalance between positive and negative samples in the phoneme sequence. To alleviate this problem, we propose three simple data augmentation methods, which effectively improve the ability of model to capture mispronounced phonemes. We conduct experiments on L2-ARCTIC, and our best performance improved from 49.29% to 56.08% in F-measure metric compared to the CNN-RNN-CTC model.
研究动机与目标
- 在一个端到端框架中利用先前的文本信息来促进和实现端到端的发错检测与诊断(MD&D)。
- 提出一个文本相关的模型,通过注意力将音频与先前的音素序列对齐,而不需要强制对齐。
- 通过简单的数据增强技术解决音素序列中的正样本/负样本不平衡。
- 在公开的MD&D基准上展示相对于CNN-RNN-CTC基线的性能提升。
提出的方法
- 三模块架构:用于先验音素序列的句子编码器、用于声学特征的音频编码器(CNN-RNN),以及带有注意力的解码器以对齐音频和文本。
- 句子编码器使用一个 Bi-LSTM,从先前文本的音素嵌入生成键/值。
- 音频编码器通过CNN-RNN(两层卷积神经网络、四层Bi-LSTM)处理243维特征以生成查询。
- 注意力通过将音频查询与文本键/值对齐来计算上下文向量;将上下文与声学特征拼接后得到最终的逐帧概率,再通过 softmax 产生音素预测。
- 不需要 CTC 时间对齐;训练使用基于注意力的交叉熵,不需要显式的时间标注。
- 三种数据增强技术用以平衡正样本(发错)和负样本:基于音素集合的(PS)、基于元音/辅音集合的(VC)以及基于混淆对的(CP)。
实验结果
研究问题
- RQ1一个文本注意力的端到端MD&D模型是否能有效利用先前文本信息在音素层面检测发错?
- RQ2简单的数据增强策略是否能在音素级别不平衡时提升模型检测发错的能力?
- RQ3音素注意力与字符注意力相比,以及相对于基线 CNN-RNN-CTC,在MD&D任务中的改进幅度有哪些?
- RQ4在标准MD&D基准(TIMIT 和 L2-ARCTIC)上,所提模型在TA、诊断准确率和F-measure方面的表现如何?
主要发现
- 用文本相关注意力替换基线使F-measure从49.29%提升到52.51%。
- 带数据增强的音素注意力达到最佳F-measure(56.08%,VC=10%)。
- 最佳配置实现了平均F-measure的提升并保持较高的TA率(例如,最佳设置的TA约为93.06%)。
- 数据增强增加了正样本并显著降低了PER(最佳PER大约在15.58%–16.13%之间,取决于增强水平)。
- 所有带数据增强的音素注意力变体都保持高TA和F-measure,当使用先验文本时,替换和删除类型的诊断错误显著减少。
- 与CNN-RNN-CTC基线相比,带有增强的音素注意力模型在评估指标上显著提升MD&D性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。