Skip to main content
QUICK REVIEW

[论文解读] Multi-encoder multi-resolution framework for end-to-end speech recognition

Ruizhi Li, Xiaofei Wang|arXiv (Cornell University)|Nov 12, 2018
Speech Recognition and Synthesis参考文献 16被引用 15
一句话总结

本文提出了一种用于端到端语音识别的多编码器多分辨率(MEMR)框架,该框架结合了双向LSTM编码器与CNN-RNN编码器,配备独立的CTC头和分层注意力机制,以融合互补的声学表征。该模型在WSJ eval92数据集上实现了3.6%的WER,相较于先前的端到端系统相对降低了32.1%。

ABSTRACT

Attention-based methods and Connectionist Temporal Classification (CTC) network have been promising research directions for end-to-end Automatic Speech Recognition (ASR). The joint CTC/Attention model has achieved great success by utilizing both architectures during multi-task training and joint decoding. In this work, we present a novel Multi-Encoder Multi-Resolution (MEMR) framework based on the joint CTC/Attention model. Two heterogeneous encoders with different architectures, temporal resolutions and separate CTC networks work in parallel to extract complimentary acoustic information. A hierarchical attention mechanism is then used to combine the encoder-level information. To demonstrate the effectiveness of the proposed model, experiments are conducted on Wall Street Journal (WSJ) and CHiME-4, resulting in relative Word Error Rate (WER) reduction of 18.0-32.1%. Moreover, the proposed MEMR model achieves 3.6% WER in the WSJ eval92 test set, which is the best WER reported for an end-to-end system on this benchmark.

研究动机与目标

  • 通过利用异构编码器的互补表征来提升端到端自动语音识别(ASR)性能。
  • 通过多分辨率编码解决单编码器模型在捕捉多样化时间与频谱特征方面的局限性。
  • 通过将每编码器连接时序分类(CTC)与联合CTC/注意力训练相结合,提升对齐与解码鲁棒性。
  • 通过分层注意力机制动态加权编码器贡献,自适应选择最具信息量的特征流。
  • 在不依赖语言学先验知识的前提下,实现在WSJ和CHiME-4等标准基准上的最先进性能。

提出的方法

  • MEMR框架采用两个并行编码器:一个基于双向LSTM(RNN),另一个结合CNN与双向LSTM(CNN-RNN),各自具有不同的时间分辨率。
  • 每个编码器均配备专用的CTC网络,以提供帧级对齐监督,提升单调性并减少误差传播。
  • 分层注意力机制在两个编码器输出上计算动态注意力权重,使模型在每个解码步骤中能更关注判别能力更强的编码器。
  • 联合CTC/注意力训练目标通过加权和(训练时λ=0.2)结合CTC与注意力损失,实现整个系统的端到端优化。
  • 模型使用单频标签平滑和束搜索解码,束宽为30(WSJ)或20(CHiME-4),并集成RNN语言模型,缩放因子γ=1.0。
  • 实验在WSJ和CHiME-4上进行,使用PyTorch和ESPnet,训练在单张GTX 1080Ti GPU上进行,小批量大小为15。

实验结果

研究问题

  • RQ1多编码器多分辨率架构是否能通过捕捉互补的声学特征来提升端到端ASR性能?
  • RQ2为每个编码器分配独立的CTC网络是否能在联合CTC/注意力训练中提升对齐效果并降低WER?
  • RQ3分层注意力机制是否能在解码过程中动态地为更具信息量的编码器流分配更高的权重?
  • RQ4编码器架构的异质性(如RNN与CNN-RNN)如何影响模型在不同数据集上的性能与鲁棒性?
  • RQ5MEMR框架在标准基准上相较于具有相似参数量的单编码器模型,性能提升程度如何?

主要发现

  • MEMR模型在WSJ eval92测试集上实现了3.6%的WER,是该基准上任何端到端ASR系统报告的最低WER。
  • 与先前的端到端系统相比,MEMR在WSJ1上的WER相对降低了32.1%(从4.6%降至3.6%)。
  • 在CHiME-4上,MEMR模型在所有通道配置(1ch、2ch、6ch)下均实现了19%的相对WER改进,et05_real_1ch的WER为26.4%。
  • 使用每编码器CTC可稳定提升性能:在结合分层注意力时,WSJ1上的WER从4.3%降至3.6%。
  • 分层注意力机制能有效适应编码器能力:当第二个编码器的LSTM层数减少时,注意力逐渐转向能力更强的第一个编码器,第一编码器的平均注意力权重从0.27上升至0.81。
  • MEMR模型在CHiME-4上相较于参数量相近的单编码器模型(21.3M vs. 21.9M)实现了18.0–20.8%的相对WER降低,且在WSJ1上实现了32.1%的相对提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。