Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Speech Recognition

Alexei Baevski, Wei-Ning Hsu|arXiv (Cornell University)|May 24, 2021
Speech Recognition and Synthesis参考文献 111被引用 21
一句话总结

该论文提出 wav2vec-U,一种用于无监督语音识别的框架,利用自监督的 wav2vec 2.0 表示来分割未标注的音频,并通过对抗训练将这些片段映射到音素。其在 TIMIT 上实现 11.3% 的音素错误率,在 Librispeech test-other 上实现 5.9% 的词错误率,性能可与使用 960 小时标注数据训练的监督系统媲美,展示了在多种语言(包括低资源语言)中的强大性能。

ABSTRACT

Despite rapid progress in the recent past, current speech recognition systems still require labeled training data which limits this technology to a small fraction of the languages spoken around the globe. This paper describes wav2vec-U, short for wav2vec Unsupervised, a method to train speech recognition models without any labeled data. We leverage self-supervised speech representations to segment unlabeled audio and learn a mapping from these representations to phonemes via adversarial training. The right representations are key to the success of our method. Compared to the best previous unsupervised work, wav2vec-U reduces the phoneme error rate on the TIMIT benchmark from 26.1 to 11.3. On the larger English Librispeech benchmark, wav2vec-U achieves a word error rate of 5.9 on test-other, rivaling some of the best published systems trained on 960 hours of labeled data from only two years ago. We also experiment on nine other languages, including low-resource languages such as Kyrgyz, Swahili and Tatar.

研究动机与目标

  • 开发一种无需任何转录训练数据的语音识别系统,从而为低资源和代表性不足的语言提供语音技术。
  • 通过利用自监督预训练和无监督微调,克服当前自动语音识别系统对大规模标注数据的依赖。
  • 证明高质量的自监督表示对成功实现无监督语音识别至关重要。
  • 引入一种无监督交叉验证指标,以在无标注开发集的情况下指导模型开发。
  • 在包括 Kyrgyz、Swahili 和 Tatar 等低资源语言在内的多种语言上评估该方法,以评估其泛化能力和可扩展性。

提出的方法

  • 该方法使用 wav2vec 2.0 从原始未标注语音音频中提取自监督表示。
  • 在潜在表示上应用 k-means 聚类以将音频分割为单元,随后进行均值池化和主成分分析(PCA),生成片段级表示。
  • 一个轻量级生成器网络(约 90k 参数)将这些片段表示映射到预测的音素序列。
  • 在生成器与判别器之间采用对抗训练,其中判别器用于区分生成的音素序列与来自未标注转录文本的音素化文本。
  • 该框架包含一种基于重建损失和聚类一致性的无监督验证指标,用于指导超参数调优和早停。
  • 系统仅使用未标注音频和文本进行端到端训练,音素化通过外部工具完成。

实验结果

研究问题

  • RQ1自监督语音表示是否能在无需任何转录数据的情况下实现有效的无监督语音识别?
  • RQ2自监督表示的质量如何影响无监督 ASR 系统的性能?
  • RQ3在缺乏监督监督的情况下,生成器与判别器之间的对抗训练能否改善音素对齐?
  • RQ4该框架在低资源和非英语语言上的泛化能力如何?
  • RQ5无监督指标是否能可靠地指导模型开发和超参数选择,而无需标注开发数据?

主要发现

  • wav2vec-U 将 TIMIT 基准上的音素错误率(PER)从此前最佳无监督方法的 26.1% 降低至 11.3%,显著提升性能。
  • 在更大的 Librispeech test-other 数据集上,该模型实现了 5.9% 的词错误率(WER),可与两年前使用 960 小时标注数据训练的监督系统媲美。
  • 该方法在其他九种语言上也表现良好,包括 Kyrgyz、Swahili 和 Tatar 等低资源语言,表明其在英语以外语言中的可行性。
  • 消融实验证实,聚类、PCA 和多阶段均值池化是关键组件,若移除则导致训练无法收敛。
  • 使用 768 维 PCA 时错误率更高(28.0% PER),而 256 维时为 22.3% PER,表明降维必须仔细调优。
  • 无监督交叉验证指标能够有效指导模型选择和早停,在 768 维 PCA 消融实验中实现 90% 的收敛率,证明其在无标注数据条件下对超参数调优的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。