Skip to main content
QUICK REVIEW

[论文解读] A Study of Enhancement, Augmentation, and Autoencoder Methods for Domain Adaptation in Distant Speech Recognition

Hao Tang, Wei-Ning Hsu|arXiv (Cornell University)|Jun 13, 2018
Speech Recognition and Synthesis被引用 5
一句话总结

本文研究了领域自适应技术——语音增强、数据增强、多条件训练和变分自编码器——在使用近距离说话人预训练模型提升远距离语音识别性能方面的应用。研究发现,通过因子分解分层变分自编码器(FHVAEs)实现的无监督领域自适应在远距离语音识别上实现了61.8%的词错误率(WER),优于数据增强方法,接近多条件训练方法,表明性能差距的根源可能并非混响,而是其他因素。

ABSTRACT

Speech recognizers trained on close-talking speech do not generalize to distant speech and the word error rate degradation can be as large as 40% absolute. Most studies focus on tackling distant speech recognition as a separate problem, leaving little effort to adapting close-talking speech recognizers to distant speech. In this work, we review several approaches from a domain adaptation perspective. These approaches, including speech enhancement, multi-condition training, data augmentation, and autoencoders, all involve a transformation of the data between domains. We conduct experiments on the AMI data set, where these approaches can be realized under the same controlled setting. These approaches lead to different amounts of improvement under their respective assumptions. The purpose of this paper is to quantify and characterize the performance gap between the two domains, setting up the basis for studying adaptation of speech recognizers from close-talking speech to distant speech. Our results also have implications for improving distant speech recognition.

研究动机与目标

  • 量化并描述AMI数据集中近距离说话人(IHM)与远距离语音(SDM)识别之间的性能差距。
  • 在统一实验设置下,评估多种领域自适应策略——语音增强、数据增强、多条件训练和自编码器——的性能。
  • 确定远距离语音识别性能下降的主要原因是否为混响,或其他因素如串扰或增益失配。
  • 评估使用因子分解分层变分自编码器(FHVAEs)进行无监督领域自适应的有效性,以对齐近距离说话人与远距离语音的分布。

提出的方法

  • 本研究使用AMI数据集中的近距离说话人(IHM)和远距离语音(SDM)条件,所有方法均基于固定的自动语音识别(ASR)模型架构进行训练。
  • 语音增强通过神经网络将噪声(远距离)语音映射为干净(近距离)语音,基于并行数据最小化L2重建损失。
  • 数据增强通过在近距离数据上应用模拟混响来模拟远距离语音,模型在真实数据与增强数据上联合训练。
  • 多条件训练同时优化IHM与SDM数据的联合损失,需在两个领域均有标注数据。
  • FHVAEs通过共享编码器与领域特定编码器,将语言内容(共享)与领域特异性因素(如混响)解耦。
  • 训练完成后,使用FHVAE的共享潜在表征作为TDNN的输入,并在IHM与SDM测试集上评估性能。

实验结果

研究问题

  • RQ1不同领域自适应技术在减少近距离与远距离语音识别WER差距方面的表现如何?
  • RQ2远距离语音识别性能下降的程度在多大程度上由混响引起,而非其他因素如串扰或增益失配?
  • RQ3通过FHVAEs实现的无监督领域自适应能否在无需目标领域标注数据的情况下,有效对齐近距离与远距离语音的潜在空间?
  • RQ4在FHVAE模型中引入共享潜在分布的对数方差是否能提升领域自适应性能?

主要发现

  • 多条件训练表现最佳,在IHM上WER为27.4%,在SDM上为70.3%,但需要两个领域均有标注数据。
  • 语音增强将SDM的WER从70.3%降低至54.2%,但需要并行未标注数据,因此实用性低于其他方法。
  • 通过模拟混响进行数据增强,SDM的WER降低至53.1%,接近多条件训练性能,但需准确模拟目标条件。
  • 使用FHVAEs进行无监督领域自适应,SDM的WER降低至61.8%,优于数据增强方法,尽管仅使用两个领域的未标注数据,仍显示出良好前景。
  • 在FHVAE特征中引入共享潜在分布的对数方差会降低性能,WER上升至72.9%,表明其可能引入噪声或无关变异性。
  • 结果表明,IHM与SDM之间性能差距的主要原因可能并非混响,而更可能是其他因素如串扰或增益失配,需进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。