Skip to main content
QUICK REVIEW

[论文解读] Completely Unsupervised Speech Recognition By A Generative Adversarial Network Harmonized With Iteratively Refined Hidden Markov Models

Kuan‐Yu Chen, Che-Ping Tsai|arXiv (Cornell University)|Apr 8, 2019
Speech Recognition and Synthesis参考文献 30被引用 15
一句话总结

本文提出了一种完全无监督的语音识别框架,结合生成对抗网络(GAN)与迭代优化的隐马尔可夫模型(HMM),从无标签的语音和文本数据中进行学习。GAN的生成器通过分类声学帧并分段采样生成音素序列,判别器则区分真实序列与生成序列;HMM通过迭代方式不断优化分割结果,在TIMIT数据集上实现了33.1%的音素错误率(PER),比之前最先进方法降低了8.5%。

ABSTRACT

Producing a large annotated speech corpus for training ASR systems remains difficult for more than 95% of languages all over the world which are low-resourced, but collecting a relatively big unlabeled data set for such languages is more achievable. This is why some initial effort have been reported on completely unsupervised speech recognition learned from unlabeled data only, although with relatively high error rates. In this paper, we develop a Generative Adversarial Network (GAN) to achieve this purpose, in which a Generator and a Discriminator learn from each other iteratively to improve the performance. We further use a set of Hidden Markov Models (HMMs) iteratively refined from the machine generated labels to work in harmony with the GAN. The initial experiments on TIMIT data set achieve an phone error rate of 33.1%, which is 8.5% lower than the previous state-of-the-art.

研究动机与目标

  • 为解决低资源语言语音识别问题,实现在仅使用无标签语音和文本数据下的训练。
  • 克服以往无监督语音识别方法依赖于理想或强制对齐边界的问题。
  • 开发一种联合学习框架,使GAN与HMM在无任何监督的情况下相互迭代优化。
  • 在仅使用无标签数据的前提下,实现完全无监督语音识别的最先进性能。

提出的方法

  • 采用GAN架构,其中生成器包含帧级音素分类器和基于分段的采样过程,从声学特征生成音素序列。
  • 判别器被训练以区分真实音素序列(来自文本句子)与生成器生成的序列。
  • 初始分割边界通过无监督方法(GAS)自动推导,随后通过在生成器输出上迭代训练HMM进行优化。
  • 在每次迭代中,使用生成器预测的音素序列重新训练HMM,从而改善分割并反馈至GAN。
  • 引入一种新型的段内损失,以增强音素段内的平滑性,提升时间一致性。
  • 框架使用数据增强和判别性特征(如LDA、MLLT)以提高鲁棒性和性能。

实验结果

研究问题

  • RQ1基于GAN的框架是否能在完全无标签数据下实现具有竞争力的无监督语音识别性能?
  • RQ2通过HMM进行迭代优化,如何提升无监督语音识别中的分割与音素序列生成质量?
  • RQ3GAN与HMM之间的协同优化在多大程度上降低了错误率,相较于独立使用GAN或HMM方法?
  • RQ4所提出的方法是否能在无强制对齐的匹配与非匹配文本-语音对上实现泛化?

主要发现

  • 所提出的GAN/HMM框架在TIMIT数据集的非匹配情况下实现了33.1%的音素错误率(PER),相比之前最先进方法相对降低了8.5%。
  • 经过三次迭代后,该方法在匹配情况下PER降至26.1%,甚至优于使用4,000个标注语音样本训练的监督HMM系统。
  • 消融实验表明,使用三音素HMM、LDA和MLLT显著提升了性能,而移除数据增强或段内损失则导致性能下降。
  • 将生成器中的DNN替换为RNN导致性能急剧下降(FER: 75.5%,PER: 71.6%),表明RNN可能干扰对齐学习。
  • 该方法在三次迭代后收敛,且在匹配与非匹配设置下所有评估指标均保持一致提升。
  • 与监督基线相比,无监督的GAN/HMM方法在仅使用15%标注数据时,性能已与标准HMM系统相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。