Skip to main content
QUICK REVIEW

[论文解读] Joint Modeling of Accents and Acoustics for Multi-Accent Speech Recognition

Xuesong Yang, Kartik Audhkhasi|arXiv (Cornell University)|Feb 7, 2018
Speech Recognition and Synthesis参考文献 20被引用 5
一句话总结

本文提出一种联合端到端学习框架,通过使用双向LSTM与连接时序分类(CTC)损失,同时训练声学模型和口音识别(AID)模型。通过在训练过程中将AID作为辅助任务,并基于预测口音应用硬切换机制,该模型在英国英语上实现5.94%的相对WER改进,在美国英语上实现9.47%的改进,优于强基准的多任务模型,表明显式的口音监督可同时提升ASR与AID性能。

ABSTRACT

The performance of automatic speech recognition systems degrades with increasing mismatch between the training and testing scenarios. Differences in speaker accents are a significant source of such mismatch. The traditional approach to deal with multiple accents involves pooling data from several accents during training and building a single model in multi-task fashion, where tasks correspond to individual accents. In this paper, we explore an alternate model where we jointly learn an accent classifier and a multi-task acoustic model. Experiments on the American English Wall Street Journal and British English Cambridge corpora demonstrate that our joint model outperforms the strong multi-task acoustic model baseline. We obtain a 5.94% relative improvement in word error rate on British English, and 9.47% relative improvement on American English. This illustrates that jointly modeling with accent information improves acoustic model performance.

研究动机与目标

  • 为解决训练与测试数据之间口音不匹配导致的自动语音识别(ASR)性能下降问题。
  • 探究在声学模型训练过程中显式建模口音信息是否能提升多口音场景下的识别准确率。
  • 探索联合训练对多口音ASR与口音识别(AID)任务的相互增益。
  • 开发一种基于预测口音选择特定口音输出层的硬切换策略,提升对口音变化的鲁棒性。
  • 证明辅助AID训练可增强多口音设置下共享声学特征的表达能力。

提出的方法

  • 使用CTC损失训练双向LSTM(BLSTM)声学模型,将语音特征映射为音素序列。
  • 辅助AID网络通过对BLSTM输出进行平均池化,生成用于分类的语音样本级口音嵌入。
  • 联合模型在低层同时使用CTC损失(主任务)和AID损失(辅助任务),通过超参数α加权损失的加权和进行联合训练。
  • 在推理阶段,基于AID网络预测的口音,采用硬切换机制选择CTC模型的特定口音输出层。
  • 模型在华尔街日报(美国英语)和剑桥(英国英语)语料库上进行训练,口音标签同时用于两个任务的监督。
  • 在α = 0.001时找到ASR与AID之间的最优权衡,使词错误率(WER)最小化并最大化AID准确率。

实验结果

研究问题

  • RQ1与标准多任务学习相比,联合训练声学建模与口音识别是否能提升多口音ASR性能?
  • RQ2将口音预测作为辅助任务,是否能增强共享网络层中口音不变与口音特定特征的学习?
  • RQ3基于预测口音的硬切换策略下,联合模型相较于基线模型的性能表现如何?
  • RQ4联合训练在多大程度上提升了口音识别系统本身的准确性?
  • RQ5在联合训练过程中,声学建模与口音识别损失之间的最优平衡是什么?

主要发现

  • 与强基线多任务声学模型相比,联合模型在英国英语上实现5.94%的相对词错误率(WER)改进,在美国英语上实现9.47%的改进。
  • Oracle性能显示,联合模型在平均上比口音特定模型(ASpec)高出17.97%的相对WER改进,比多任务模型(MTLP)高出6.81%。
  • 当使用独立的AID模型进行硬切换时,联合模型在美国英语上相对于ASpec实现22.52%的相对WER改进,优于MTLP基线(14.41%改进)。
  • 最优AID损失权重α = 0.001时,WER最低达到8.9%,AID准确率达到97.77%,且在α的广泛取值范围内(>92%)保持高准确率。
  • 联合模型显著提升了AID性能,在α = 0.005时达到97.77%的准确率,表明联合训练能同时增强ASR与AID任务。
  • 结果表明,训练期间显式口音监督可增强特征学习,共享层能够捕捉具有表现力的口音无关表征,从而优化口音特定模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。