Skip to main content
QUICK REVIEW

[论文解读] UniSpeech: Unified Speech Representation Learning with Labeled and Unlabeled Data

Chengyi Wang, Yu Wu|arXiv (Cornell University)|Jan 19, 2021
Speech Recognition and Synthesis参考文献 41被引用 20
一句话总结

UniSpeech 提出了一种统一的预训练框架,通过同时使用有标签和无标签数据,联合优化监督语音音素 CTC 学习与语音感知对比自监督学习。通过显式地利用掩码标记替换引导量化器学习特定语音识别(SR)的表示,UniSpeech 在跨语言和领域迁移的语音识别任务中达到最先进性能,相较于监督迁移学习,相对音素错误率降低高达 26.9%,相较于自监督预训练降低 13.4%。

ABSTRACT

In this paper, we propose a unified pre-training approach called UniSpeech to learn speech representations with both unlabeled and labeled data, in which supervised phonetic CTC learning and phonetically-aware contrastive self-supervised learning are conducted in a multi-task learning manner. The resultant representations can capture information more correlated with phonetic structures and improve the generalization across languages and domains. We evaluate the effectiveness of UniSpeech for cross-lingual representation learning on public CommonVoice corpus. The results show that UniSpeech outperforms self-supervised pretraining and supervised transfer learning for speech recognition by a maximum of 13.4% and 17.8% relative phone error rate reductions respectively (averaged over all testing languages). The transferability of UniSpeech is also demonstrated on a domain-shift speech recognition task, i.e., a relative word error rate reduction of 6% against the previous approach.

研究动机与目标

  • 通过利用有标签和无标签数据,解决低资源语音识别的挑战。
  • 通过学习语音感知表示,提升在不同语言和领域间的泛化能力。
  • 缓解代码本坍塌问题,并改善离散潜在单元与音素单位之间的对齐。
  • 在多任务框架中统一监督学习与自监督学习,以实现更优的表示学习。
  • 提升预训练模型在低资源和域外设置下的可迁移性。

提出的方法

  • UniSpeech 使用包含卷积特征提取器、Transformer 编码器和可学习量化器的模型架构,生成离散潜在表示。
  • 对于有标签数据,应用序列级 CTC 损失,将上下文表示与音素标签对齐。
  • 引入一种掩码替换策略,即用量化表示替换一部分上下文表示,以显式引导量化器向音素单位靠拢。
  • 对于无标签数据,利用掩码表示和离散码进行对比学习,以提升表示质量。
  • 模型在有标签的高资源数据和无标签的低资源数据上联合预训练,随后在小规模有标签低资源数据上微调。
  • 通过优化活跃码字数量和对齐熵,训练量化器以生成多样化且具有语音学意义的词典。

实验结果

研究问题

  • RQ1将监督 CTC 学习与对比自监督学习相结合,能否提升语音表示质量?
  • RQ2显式引导量化器向音素单位靠拢,是否能带来更好的代码本多样性与音素对齐?
  • RQ3与纯自监督或监督预训练相比,UniSpeech 在跨语言语音识别中的表现如何?
  • RQ4UniSpeech 是否能有效泛化到领域迁移的语音识别任务?
  • RQ5哪些超参数设置(如替换概率、损失权重)能实现最佳性能?

主要发现

  • 在跨语言语音识别任务中,UniSpeech 相较于监督迁移学习,相对音素错误率降低高达 26.9%。
  • 在 CommonVoice 基准测试中,相较于自监督预训练,相对错误率降低 13.4%。
  • 模型学习到的代码本更具多样性,活跃码字达 25,743 个,远超 XLSR 的 3,645 个,表明其语音聚类能力更强。
  • 平均对齐熵为 0.83,表明离散单元与音素的对齐比 XLSR(熵值 1.34)更精确。
  • 当 50% 的上下文表示被量化表示替换时(r=0.5),性能最佳;而当 r=0 时,性能相对下降 7.8%。
  • 在领域迁移的 Librispeech 到 Tedlium3 迁移任务中,相对词错误率降低 6%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。