Skip to main content
QUICK REVIEW

[论文解读] Language Identification with Deep Bottleneck Features

Zhanyu Ma, Hong Yu|arXiv (Cornell University)|Sep 18, 2018
Natural Language Processing Techniques参考文献 61被引用 3
一句话总结

该论文提出一种基于深度瓶颈(DNN-BN)特征和LSTM网络的端到端语音语言识别(SLD)系统,通过基于相位音高变换的时间尺度修改(TSM)扩展短语音,提升性能。通过结合1秒和3秒语音的原始、加速和减速版本,该方法在短输入上将SLD准确率提升高达50%,在AP17-OLR测试集上实现C_avg = 0.006和EER = 0.08%。

ABSTRACT

In this paper we proposed an end-to-end short utterances speech language identification(SLD) approach based on a Long Short Term Memory (LSTM) neural network which is special suitable for SLD application in intelligent vehicles. Features used for LSTM learning are generated by a transfer learning method. Bottle-neck features of a deep neural network (DNN) which are trained for mandarin acoustic-phonetic classification are used for LSTM training. In order to improve the SLD accuracy of short utterances a phase vocoder based time-scale modification(TSM) method is used to reduce and increase speech rated of the test utterance. By splicing the normal, speech rate reduced and increased utterances, we can extend length of test utterances so as to improved improved the performance of the SLD system. The experimental results on AP17-OLR database shows that the proposed methods can improve the performance of SLD, especially on short utterance with 1s and 3s durations.

研究动机与目标

  • 解决智能汽车应用中极短语音输入下语音语言识别(SLD)准确率低下的挑战。
  • 提升在短时长输入(1秒和3秒)下的性能,此类输入因统计信息不足导致传统模型失效。
  • 开发一种轻量化、响应快速的SLD系统,适用于智能汽车中的实时部署。
  • 利用迁移学习和信号预处理增强特征表示与模型鲁棒性,无需重新训练。

提出的方法

  • 使用预训练的DNN进行普通话音素分类,以提取编码语音判别信息的深度瓶颈(DNN-BN)特征。
  • 应用基于相位音高变换的时间尺度修改(TSM),生成语音速率改变(α = 0.8 和 1.2)的多个测试语音版本。
  • 将原始、加速和减速语音拼接,以延长输入长度并丰富短语音的时间上下文。
  • 将长度扩展语音中的PLP+基频特征以100帧为单位输入双层LSTM分类器。
  • 将帧级DNN-BN特征打包成固定大小的块,并使用重复填充处理可变长度输入。
  • 使用来自音素分类器的DNN-BN特征端到端训练SLD系统,随后通过基于LSTM的分类器进行语言预测。

实验结果

研究问题

  • RQ1基于TSM的输入长度扩展是否能提升极短语音(1秒和3秒)的SLD性能?
  • RQ2使用来自音素分类器的DNN-BN特征是否相比原始声学特征能提升SLD准确率?
  • RQ3原始、加速和减速语音的组合如何影响SLD性能?
  • RQ4轻量化、端到端的LSTM-based SLD系统是否能在极小模型尺寸和快速推理下实现高准确率?

主要发现

  • 所提出的TSM-DNN-BN-LSTM模型在完整测试集上将C_avg降至0.006,EER降至0.08%,优于i-vector和LSTM基线模型。
  • 在1秒语音上,EER从i-vector的17.24%降至6.76%,相对提升60.6%。
  • 在3秒语音上,EER从i-vector的8.67%降至2.62%,相对提升69.5%。
  • TSM方法在无需重新训练模型的前提下,使长和中等长度语音的性能提升约50%,极短语音提升约30%。
  • 拼接一个原始、一个加速(α = 0.8)和一个减速(α = 1.2)语音时性能最佳,且α = 0.8和1.2为最优参数。
  • 模型仅占用约20MB磁盘空间,适合在智能汽车等资源受限环境中的实时部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。