[论文解读] UniSpeech: Unified Speech Representation Learning with Labeled and Unlabeled Data
UniSpeech 提出了一种统一的预训练框架,通过同时使用有标签和无标签数据,联合优化监督语音音素 CTC 学习与语音感知对比自监督学习。通过显式地利用掩码标记替换引导量化器学习特定语音识别(SR)的表示,UniSpeech 在跨语言和领域迁移的语音识别任务中达到最先进性能,相较于监督迁移学习,相对音素错误率降低高达 26.9%,相较于自监督预训练降低 13.4%。
In this paper, we propose a unified pre-training approach called UniSpeech to learn speech representations with both unlabeled and labeled data, in which supervised phonetic CTC learning and phonetically-aware contrastive self-supervised learning are conducted in a multi-task learning manner. The resultant representations can capture information more correlated with phonetic structures and improve the generalization across languages and domains. We evaluate the effectiveness of UniSpeech for cross-lingual representation learning on public CommonVoice corpus. The results show that UniSpeech outperforms self-supervised pretraining and supervised transfer learning for speech recognition by a maximum of 13.4% and 17.8% relative phone error rate reductions respectively (averaged over all testing languages). The transferability of UniSpeech is also demonstrated on a domain-shift speech recognition task, i.e., a relative word error rate reduction of 6% against the previous approach.
研究动机与目标
- 通过利用有标签和无标签数据,解决低资源语音识别的挑战。
- 通过学习语音感知表示,提升在不同语言和领域间的泛化能力。
- 缓解代码本坍塌问题,并改善离散潜在单元与音素单位之间的对齐。
- 在多任务框架中统一监督学习与自监督学习,以实现更优的表示学习。
- 提升预训练模型在低资源和域外设置下的可迁移性。
提出的方法
- UniSpeech 使用包含卷积特征提取器、Transformer 编码器和可学习量化器的模型架构,生成离散潜在表示。
- 对于有标签数据,应用序列级 CTC 损失,将上下文表示与音素标签对齐。
- 引入一种掩码替换策略,即用量化表示替换一部分上下文表示,以显式引导量化器向音素单位靠拢。
- 对于无标签数据,利用掩码表示和离散码进行对比学习,以提升表示质量。
- 模型在有标签的高资源数据和无标签的低资源数据上联合预训练,随后在小规模有标签低资源数据上微调。
- 通过优化活跃码字数量和对齐熵,训练量化器以生成多样化且具有语音学意义的词典。
实验结果
研究问题
- RQ1将监督 CTC 学习与对比自监督学习相结合,能否提升语音表示质量?
- RQ2显式引导量化器向音素单位靠拢,是否能带来更好的代码本多样性与音素对齐?
- RQ3与纯自监督或监督预训练相比,UniSpeech 在跨语言语音识别中的表现如何?
- RQ4UniSpeech 是否能有效泛化到领域迁移的语音识别任务?
- RQ5哪些超参数设置(如替换概率、损失权重)能实现最佳性能?
主要发现
- 在跨语言语音识别任务中,UniSpeech 相较于监督迁移学习,相对音素错误率降低高达 26.9%。
- 在 CommonVoice 基准测试中,相较于自监督预训练,相对错误率降低 13.4%。
- 模型学习到的代码本更具多样性,活跃码字达 25,743 个,远超 XLSR 的 3,645 个,表明其语音聚类能力更强。
- 平均对齐熵为 0.83,表明离散单元与音素的对齐比 XLSR(熵值 1.34)更精确。
- 当 50% 的上下文表示被量化表示替换时(r=0.5),性能最佳;而当 r=0 时,性能相对下降 7.8%。
- 在领域迁移的 Librispeech 到 Tedlium3 迁移任务中,相对词错误率降低 6%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。