Skip to main content
QUICK REVIEW

[论文解读] LSTM-TDNN with convolutional front-end for Dialect Identification in the 2019 Multi-Genre Broadcast Challenge

Xiaoxiao Miao, Ian McLoughlin|arXiv (Cornell University)|Dec 19, 2019
Speech Recognition and Synthesis参考文献 12被引用 4
一句话总结

该论文提出一种CLSTM架构,结合卷积神经网络前端与长短期记忆网络后端,用于MGB-5挑战中的细粒度阿拉伯方言识别。通过在低资源方言上应用时间尺度变换(TSM)进行数据增强,以及传统数据增强(TTDA),取得第二名成绩,优于标准DNN x-vector系统,通过改进时间依赖性建模与数据平衡性实现性能提升。

ABSTRACT

This paper presents a novel Dialect Identification (DID) system developed for the Fifth Edition of the Multi-Genre Broadcast challenge, the task of Fine-grained Arabic Dialect Identification (MGB-5 ADI Challenge). The system improves upon traditional DNN x-vector performance by employing a Convolutional and Long Short Term Memory-Recurrent (CLSTM) architecture to combine the benefits of a convolutional neural network front-end for feature extraction and a back-end recurrent neural to capture longer temporal dependencies. Furthermore we investigate intensive augmentation of one low resource dialect in the highly unbalanced training set using time-scale modification (TSM). This converts an utterance to several time-stretched or time-compressed versions, subsequently used to train the CLSTM system without using any other corpus. In this paper, we also investigate speech augmentation using MUSAN and the RIR datasets to increase the quantity and diversity of the existing training data in the normal way. Results show firstly that the CLSTM architecture outperforms a traditional DNN x-vector implementation. Secondly, adopting TSM-based speed perturbation yields a small performance improvement for the unbalanced data, finally that traditional data augmentation techniques yield further benefit, in line with evidence from related speaker and language recognition tasks. Our system achieved 2nd place ranking out of 15 entries in the MGB-5 ADI challenge, presented at ASRU 2019.

研究动机与目标

  • 解决在高度不平衡、低资源训练数据下进行细粒度阿拉伯方言识别(DID)的挑战。
  • 通过集成CNN-LSTM混合架构,改进对时间与频谱特征的建模,超越传统DNN x-vector系统。
  • 在不使用外部语料库的前提下,通过应用时间尺度变换(TSM)缓解低资源方言(如约旦方言,JOR)的数据不平衡问题。
  • 评估时间尺度变换(TSM)与传统训练数据增强(TTDA)在提升泛化能力与降低错误率方面的有效性。
  • 在严格的数据使用限制下,实现MGB-5 ADI挑战中的最先进性能。

提出的方法

  • 采用CLSTM架构:CNN前端从语音帧中提取局部上下文感知特征,随后通过LSTM层建模长期时间依赖性。
  • 通过RTISI算法应用时间尺度变换(TSM),生成低资源方言语音的时移拉伸或压缩版本,提升训练数据多样性。
  • 仅对最不具代表性的方言(JOR)应用TSM,以在不使用外部数据的前提下平衡训练集,符合挑战规则。
  • 将TSM与传统数据增强(TTDA)结合,使用MUSAN噪声与RIR混响数据集,进一步提升数据可变性与模型鲁棒性。
  • 使用端到端反向传播与交叉熵损失函数训练CLSTM模型,优化段级分类任务。
  • 在最终分类前,通过统计池化(均值与标准差)将帧级输出转换为固定维度嵌入表示。

实验结果

研究问题

  • RQ1CNN-LSTM混合架构(CLSTM)是否能在细粒度阿拉伯方言识别中超越标准DNN x-vector系统?
  • RQ2在不允许使用外部数据的前提下,时间尺度变换(TSM)在低资源方言上的性能提升程度如何?
  • RQ3使用噪声与混响的传统数据增强(TTDA)在提升所有方言的DID性能方面效果如何?
  • RQ4TSM与TTDA的结合是否能产生协同增益,提升模型泛化能力与降低错误率?
  • RQ5相似方言(如沙姆阿拉伯语)之间的混淆模式如何反映模型捕捉细微声学与语音差异的能力?

主要发现

  • CLSTM架构在测试集上达到93.06%的准确率与2.09%的EER,优于基线DNN x-vector系统。
  • 在低资源约旦方言(JOR)上应用TSM增强后,性能得到提升,尽管数据量小,仍达到80.17%的准确率。
  • 结合TSM与TTDA的模型取得最佳整体测试性能:93.06%准确率与2.09% EER,略优于单一方法。
  • 黎巴嫩方言(LEB)准确率最高,达96.97%,表明模型对代表性充分的方言具有较强的判别能力。
  • 混淆度最高出现在闪米特方言中(如JOR、PAL、SYR、LEB),表明其共享的语音与词汇特征增加了误分类风险。
  • 尽管闪米特方言高度相似,模型在部分方言对中仍表现出较低混淆度,可能归因于CLSTM架构捕捉到的细微声学与语音差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。