Skip to main content
QUICK REVIEW

[论文解读] Combined Acoustic and Pronunciation Modelling for Non-Native Speech Recognition

Ghazi Bouselmi, Dominique Fohr|ArXiv.org|Nov 6, 2007
Speech Recognition and Synthesis参考文献 6被引用 4
一句话总结

本文提出了一种结合发音建模与声学自适应的方法,以提升非英语母语英语语音识别性能。通过使用音素混淆矩阵关联母语(L1)与目标语(L2)的发音,并对声学模型应用MLLR/MAP自适应或模型重估计,该方法在HIWIRE数据库上实现了46%至71%的相对词错误率降低,其中结合模型重估计与发音建模的方法表现最佳。

ABSTRACT

In this paper, we present several adaptation methods for non-native speech recognition. We have tested pronunciation modelling, MLLR and MAP non-native pronunciation adaptation and HMM models retraining on the HIWIRE foreign accented English speech database. The ``phonetic confusion'' scheme we have developed consists in associating to each spoken phone several sequences of confused phones. In our experiments, we have used different combinations of acoustic models representing the canonical and the foreign pronunciations: spoken and native models, models adapted to the non-native accent with MAP and MLLR. The joint use of pronunciation modelling and acoustic adaptation led to further improvements in recognition accuracy. The best combination of the above mentioned techniques resulted in a relative word error reduction ranging from 46% to 71%.

研究动机与目标

  • 提升标准ASR系统对非英语母语者语音识别的性能,因为这些系统通常在仅使用母语语音训练时对非母语者表现不佳。
  • 解决在实际应用场景(如空中交通管制)中非母语者使用英语时的外语口音问题。
  • 开发一种可扩展的方法,无需为每对L1/L2语言收集大规模专用的非母语语音语料库。
  • 探究将发音建模与MLLR、MAP及模型重估计等声学自适应技术结合的有效性。
  • 评估在发音建模中使用声学自适应后的母语模型是否能提升识别准确率。

提出的方法

  • 该方法采用一种‘音素混淆’机制,将每种目标语言(SL)音素映射为多个基于发音相似性的母语(NL)音素序列。
  • 利用非母语语音数据,通过MLLR(最大似然线性回归)和MAP(最大后验概率)技术对声学模型进行非母语口音的自适应。
  • 通过在混淆矩阵中同时使用标准SL模型和NL模型(标准或自适应)来结合声学自适应与发音建模。
  • 利用小规模自适应语料对SL模型进行模型重估计,以更好地捕捉非母语口音特征。
  • 修改词典,加入源自混淆矩阵的替代发音,以支持对非母语变体的识别。
  • 实验对比了在HIWIRE数据库上使用约束语法与自由词环语法时,各种HMM模型组合(标准、自适应或重估计)的性能。

实验结果

研究问题

  • RQ1将发音建模与声学自适应相结合,是否能显著降低非母语语音识别中的词错误率?
  • RQ2在发音建模中使用声学自适应后的母语模型,是否比使用标准模型带来更好的性能?
  • RQ3不同自适应技术(MLLR、MAP与模型重估计)对非母语口音识别准确率的影响如何?
  • RQ4性能提升是否依赖于所使用的语法类型(约束语法 vs. 自由词环语法)?
  • RQ5混淆矩阵中模型差异性对识别准确率有何影响?

主要发现

  • 发音建模与声学自适应的联合使用,使词错误率相比基线系统降低了46%至71%。
  • 最佳性能由'Confusion7'配置实现,该配置结合了标准英语模型的模型重估计与使用标准英语模型和重估计模型之间混淆矩阵的发音建模。
  • 模型重估计优于MLLR与MAP自适应,尤其在约束语法条件下表现更优,自由语法下实现1.4% WER与3.2% SER。
  • 在混淆矩阵中使用相同模型(如标准 vs. 标准)导致性能劣于使用不同模型,表明模型差异性可提升识别能力。
  • 'Confusion6'系统(在两个混淆集均使用MAP自适应的英语模型)优于'Confusion5'系统(使用MAP自适应的母语模型),可能是因为英语模型自适应具有监督性质。
  • 'Confusion1'与'Confusion2'系统在使用MAP自适应时性能劣于基线,表明在模型完全相同或高度相似时产生混淆会降低系统鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。