Skip to main content
QUICK REVIEW

[论文解读] DARTS: Dialectal Arabic Transcription System

Sameer Khurana, Ahmed Ali|arXiv (Cornell University)|Sep 26, 2019
Speech Recognition and Synthesis参考文献 24被引用 5
一句话总结

本论文提出 DARTS,一种基于深度学习的低资源埃及方言语音转写系统,通过利用高资源现代标准阿拉伯语(MGB-2)的迁移学习以及使用超过500小时未标注的YouTube语音进行半监督学习,结合混合DNN架构(含CNN、TDNN和LSTM层)、序列判别性训练以及n-gram/RNN语言模型重排序,实现了在MGB-3评估集上的最先进词错误率(WER)35.8%。

ABSTRACT

We present the speech to text transcription system, called DARTS, for low resource Egyptian Arabic dialect. We analyze the following; transfer learning from high resource broadcast domain to low-resource dialectal domain and semi-supervised learning where we use in-domain unlabeled audio data collected from YouTube. Key features of our system are: A deep neural network acoustic model that consists of a front end Convolutional Neural Network (CNN) followed by several layers of Time Delayed Neural Network (TDNN) and Long-Short Term Memory Recurrent Neural Network (LSTM); sequence discriminative training of the acoustic model; n-gram and recurrent neural network language model for decoding and N-best list rescoring. We show that a simple transfer learning method can achieve good results. The results are further improved by using unlabeled data from YouTube in a semi-supervised setup. Various systems are combined to give the final system that achieves the lowest word error on on the community standard Egyptian-Arabic speech dataset (MGB-3).

研究动机与目标

  • 解决埃及方言语音识别(ASR)在低资源环境下缺乏足够转录数据的挑战。
  • 探究从高资源现代标准阿拉伯语(MSA)广播数据(MGB-2)进行迁移学习对低资源方言阿拉伯语(MGB-3)的ASR性能提升效果。
  • 探索利用超过500小时的领域内未标注YouTube语音进行半监督学习,以提升低资源方言的ASR性能。
  • 开发一个鲁棒的端到端语音转写系统,在MGB-3基准测试中超越现有方法。
  • 通过迁移学习评估该方法在其他阿拉伯方言(如摩洛哥阿拉伯语)上的泛化能力。

提出的方法

  • 训练一个结合前端卷积神经网络(CNN)、多个时延神经网络(TDNN)层和长短期记忆(LSTM)循环层的深度神经网络声学模型。
  • 应用序列判别性训练以优化声学模型在转录语音识别任务上的性能。
  • 通过迁移学习策略:先在1,200小时的MGB-2现代标准阿拉伯语广播数据上进行预训练,再在16小时的转录MGB-3埃及方言数据上进行微调。
  • 在半监督学习设置中引入超过500小时的埃及方言频道YouTube未标注语音,以提升模型泛化能力。
  • 在解码过程中同时使用n-gram和循环神经网络语言模型(RNNLM),并通过N-best列表重排序提升转录准确性。
  • 使用有限状态转换器(FST)框架构建语言模型,整合语法和词典以构建最终的解码图。

实验结果

研究问题

  • RQ1从高资源现代标准阿拉伯语(MGB-2)进行迁移学习是否能显著提升低资源埃及方言(MGB-3)的ASR性能?
  • RQ2使用领域内未标注YouTube语音进行半监督学习在多大程度上能提升方言阿拉伯语的ASR性能?
  • RQ3在低资源环境下,将深度声学模型(CNN-TDNN-LSTM)与序列判别性训练结合,与简单架构相比有何性能差异?
  • RQ4在MGB-3评估集上,使用n-gram和RNNLM进行语言模型重排序是否能降低词错误率(WER)?
  • RQ5所提出的DARTS系统能否通过迁移学习泛化到其他阿拉伯方言(如摩洛哥阿拉伯语)?

主要发现

  • DARTS系统在MGB-3评估集上实现了35.8%的最先进词错误率(WER),优于此前最佳结果37.5%。
  • 使用CNN预处理模块可提升性能,仅通过迁移学习(无BLSTM)的DARTS模型在MGB-3上达到39.8% WER。
  • 结合DARTS模型与超过500小时未标注YouTube语音进行半监督学习,可使WER从39.8%降至39.5%。
  • 四模型系统融合(DARTS、CNN-TDNN、DARTS-BLSTM以及含YouTube数据的CNN-TDNN)在语言模型重排序前将WER降低至36.5%。
  • 使用4-gram和RNNLM进行语言模型重排序后,WER进一步降低至35.8%,证明了混合语言建模的有效性。
  • 在摩洛哥阿拉伯语(MGB-5)上,该系统相比基线TDNN模型提升5个百分点(WER 65% vs. 70%),表明迁移学习在语言差异较大的方言之间也具有效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。