Skip to main content
QUICK REVIEW

[论文解读] Phonemic and Graphemic Multilingual CTC Based Speech Recognition

Markus Müller, Sebastian Stüker|arXiv (Cornell University)|Nov 13, 2017
Speech Recognition and Synthesis参考文献 25被引用 4
一句话总结

本文提出了一种基于CTC的多语言语音识别系统,使用四种语言(英语、法语、德语、土耳其语)共享的音素和字素单元,并引入语言特征向量(LFVs)以提升性能。通过利用多语言瓶颈特征和LFVs,该模型缩小了多语言系统与单语言系统之间的误差差距,在德语和土耳其语中尤其显著地提升了词错误率(TER),证明了无需语言特定发音词典即可实现有效的跨语言适应。

ABSTRACT

Training automatic speech recognition (ASR) systems requires large amounts of data in the target language in order to achieve good performance. Whereas large training corpora are readily available for languages like English, there exists a long tail of languages which do suffer from a lack of resources. One method to handle data sparsity is to use data from additional source languages and build a multilingual system. Recently, ASR systems based on recurrent neural networks (RNNs) trained with connectionist temporal classification (CTC) have gained substantial research interest. In this work, we extended our previous approach towards training CTC-based systems multilingually. Our systems feature a global phone set, based on the joint phone sets of each source language. We evaluated the use of different language combinations as well as the addition of Language Feature Vectors (LFVs). As contrastive experiment, we built systems based on graphemes as well. Systems having a multilingual phone set are known to suffer in performance compared to their monolingual counterparts. With our proposed approach, we could reduce the gap between these mono- and multilingual setups, using either graphemes or phonemes.

研究动机与目标

  • 通过使用多种高资源语言的数据联合训练单一多语言ASR系统,以缓解低资源语言中的数据稀疏问题。
  • 缩小多语言与单语言语音识别系统之间的性能差距,特别是在低资源场景下。
  • 评估语言特征向量(LFVs)在无需语言特定发音词典的情况下,将共享RNN/CTC模型适配至多种语言的有效性。
  • 比较在多语言CTC框架中,基于音素与基于字素的建模单元的性能表现。
  • 探究多语言瓶颈特征(ML-BNFs)是否能提升多种语言的识别准确率。

提出的方法

  • 系统使用从所有四种目标语言(英语、法语、德语、土耳其语)的联合音位库存中提取的共享全局音素集。
  • 在所有四种语言的数据上训练多语言瓶颈特征(ML-BNFs),并将其作为RNN/CTC模型的输入,以改善声学表征学习。
  • 在TDNN/CNN层之后引入语言特征向量(LFVs),以编码语言特异性特征,使模型在推理阶段能够适应不同语言。
  • 采用连接时序分类(CTC)进行训练,使用小批量随机梯度下降和批量归一化,且在第一轮训练中按语音长度排序以稳定训练过程。
  • 对于基于字素的系统,省略发音词典;相反,模型直接从RNN中学习字素到音素的映射,性能通过TER和使用字符级语言模型的WER进行评估(英语)。
  • 在TER评估中采用贪婪解码策略,不使用外部语言模型;而WER则通过独立的基于字符的语言模型计算。

实验结果

研究问题

  • RQ1基于共享全局音素集训练的多语言CTC-ASR系统,若结合语言适应技术,能否实现接近单语言系统的性能?
  • RQ2语言特征向量(LFVs)在缩小多语言与单语言ASR系统性能差距方面,在多种语言中有多高效?
  • RQ3使用字素而非音素作为建模单元是否能提升多语言ASR性能,尤其是在低资源设置下?
  • RQ4与标准的对数梅尔倒谱系数+音高特征相比,多语言瓶颈特征(ML-BNFs)在多大程度上提升了识别准确率?
  • RQ5添加LFVs是否能在语音与拼写复杂度差异较大的多种语言中实现一致的性能提升?

主要发现

  • 使用多语言瓶颈特征(ML-BNFs)使德语的TER降低了2.8个百分点(从10.8%降至7.8%),英语也降低了2.8个百分点(从13.0%降至10.2%),表明其在多种语言中具有良好的泛化能力。
  • 添加语言特征向量(LFVs)使多语言系统的TER在德语中降低1.0个百分点(从9.9%降至8.9%),英语降低1.2个百分点(从14.1%降至12.9%),法语降低2.1个百分点(从12.8%降至10.7%),表明其在多种语言中均带来稳定提升。
  • 对于基于字素的系统,LFVs使德语的TER从9.1%降至7.9%,英语从15.6%降至14.3%,土耳其语从7.9%降至7.3%,表明即使无发音词典,模型也能实现有效适应。
  • 英语的词错误率(WER)从30.8%(多语言系统)降至28.1%(加入LFVs),证实TER的改善可转化为更优的词级识别性能。
  • 单语言系统在德语(TER 7.8%)和英语(TER 10.2%)中达到最低误差,但加入LFVs的多语言系统将误差差距缩小至1.0–2.0个百分点以内,表明多语言架构具备强大性能。
  • 结果表明,对于德语和土耳其语,基于字素的系统优于基于音素的系统,可能是因为RNN能直接学习复杂的字母到发音规则;而英语和法语则更受益于显式的发音建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。