Skip to main content
QUICK REVIEW

[论文解读] Multitask Learning with CTC and Segmental CRF for Speech Recognition

Liang Lu, Lingpeng Kong|arXiv (Cornell University)|Feb 21, 2017
Speech Recognition and Synthesis参考文献 25被引用 11
一句话总结

该论文提出了一种多任务学习框架,通过共享的双向LSTM编码器联合训练连接时序分类(CTC)模型与分段条件随机场(SCRF)模型。在TIMIT数据集上进行端到端训练时,通过插值CTC与SCRF的损失函数,该方法提升了两个模型的识别准确率,并使CTC预训练能够加速联合模型的收敛。

ABSTRACT

Segmental conditional random fields (SCRFs) and connectionist temporal classification (CTC) are two sequence labeling methods used for end-to-end training of speech recognition models. Both models define a transcription probability by marginalizing decisions about latent segmentation alternatives to derive a sequence probability: the former uses a globally normalized joint model of segment labels and durations, and the latter classifies each frame as either an output symbol or a "continuation" of the previous label. In this paper, we train a recognition model by optimizing an interpolation between the SCRF and CTC losses, where the same recurrent neural network (RNN) encoder is used for feature extraction for both outputs. We find that this multitask objective improves recognition accuracy when decoding with either the SCRF or CTC models. Additionally, we show that CTC can also be used to pretrain the RNN encoder, which improves the convergence rate when learning the joint model.

研究动机与目标

  • 通过多任务学习结合CTC与SCRF,提升端到端语音识别的准确率。
  • 探究通过插值损失函数进行联合训练是否相比独立模型能提升泛化能力与鲁棒性。
  • 探索将CTC作为共享RNN编码器的预训练目标,以加速联合SCRF-CTC模型的收敛。
  • 评估联合模型与独立的CTC与SCRF系统在计算效率与训练动态方面的差异。

提出的方法

  • 共享的双向LSTM编码器从输入语音帧中提取声学特征。
  • 相同的编码器为CTC与SCRF头生成输出,实现联合优化。
  • 损失函数是CTC损失(帧级,交叉熵)与SCRF损失(序列级,全局归一化)的插值。
  • 联合训练目标结合了帧级CTC监督与序列级SCRF判别式训练。
  • 在联合训练前应用CTC预训练以初始化编码器,从而加快收敛速度。
  • 训练采用随机梯度下降,配合学习率衰减与Dropout正则化(丢弃率0.2)。

实验结果

研究问题

  • RQ1通过多任务学习联合训练CTC与SCRF是否能提升相比独立模型的识别准确率?
  • RQ2CTC与SCRF损失的插值是否具有正则化效应,从而增强泛化能力?
  • RQ3对共享RNN编码器进行CTC预训练是否能加速联合SCRF-CTC模型的收敛?
  • RQ4联合模型的计算成本与独立的CTC与SCRF系统相比如何?
  • RQ5多任务学习带来的性能提升是否依赖于输入特征类型(例如FBANK与fMLLR)?

主要发现

  • 使用fMLLR特征时,CTC与SCRF的多任务学习将TIMIT开发集的音素错误率(PER)从SRNN的16.6%和CTC的16.7%分别降低至15.9%与16.2%。
  • 使用FBANK特征时,联合模型将PER从SRNN的18.1%与CTC的17.7%分别降低至17.5%与17.2%。
  • CTC预训练策略显著加速了联合模型的收敛,训练曲线清晰显示了这一点。
  • 联合模型在使用最佳路径解码时达到了CTC级别的性能,且与先前工作(如Graves等人,2013年)中使用束搜索解码的结果相当或更优。
  • 在相同编码器下,CTC模型的推理速度比SCRF模型快3至4倍,而联合模型的计算开销略高于独立的SCRF模型。
  • 多任务学习带来的性能提升在FBANK特征下比在fMLLR特征下更显著,表明性能增益与特征类型存在依赖关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。