Skip to main content
QUICK REVIEW

[论文解读] Injecting Text in Self-Supervised Speech Pretraining

Zhehuai Chen, Yu Zhang|arXiv (Cornell University)|Aug 27, 2021
Speech Recognition and Synthesis参考文献 55被引用 4
一句话总结

本文提出 tts4pretrain 方法,通过在未转录语音和未说话文本生成的语音上联合预训练,增强自监督语音表征学习。通过在 TTS 生成的语音上引入辅助序列损失(如 CTC、音素、词片),模型注入词汇和语音信息,使 LibriSpeech 上的 WER 相对降低 10%,并仅用 100 小时的转录数据即可达到 5,000 小时转录数据的性能。

ABSTRACT

Self-supervised pretraining for Automated Speech Recognition (ASR) has shown varied degrees of success. In this paper, we propose to jointly learn representations during pretraining from two different modalities: speech and text. The proposed method, tts4pretrain complements the power of contrastive learning in self-supervision with linguistic/lexical representations derived from synthesized speech, effectively learning from untranscribed speech and unspoken text. Lexical learning in the speech encoder is enforced through an additional sequence loss term that is coupled with contrastive loss during pretraining. We demonstrate that this novel pretraining method yields Word Error Rate (WER) reductions of 10% relative on the well-benchmarked, Librispeech task over a state-of-the-art baseline pretrained with wav2vec2.0 only. The proposed method also serves as an effective strategy to compensate for the lack of transcribed speech, effectively matching the performance of 5000 hours of transcribed speech with just 100 hours of transcribed speech on the AMI meeting transcription task. Finally, we demonstrate WER reductions of up to 15% on an in-house Voice Search task over traditional pretraining. Incorporating text into encoder pretraining is complimentary to rescoring with a larger or in-domain language model, resulting in additional 6% relative reduction in WER.

研究动机与目标

  • 解决自监督语音预训练在缺乏转录数据时难以捕捉语言和语音结构的局限性。
  • 探究通过文本到语音(TTS)合成的未说话文本是否能增强语音表征学习。
  • 减少下游 ASR 微调对大规模转录语音数据的依赖。
  • 评估在合成语音上结合对比学习与辅助 ASR 风格损失的有效性。
  • 探究在预训练阶段注入文本信息后,语言模型融合是否仍具互补性。

提出的方法

  • 该方法使用 TTS 系统从未说话文本生成语音,为预训练提供类似监督的信号。
  • 在合成语音上训练一个辅助解码头,采用序列级目标函数(如 CTC、RNN-T),以强制其与文本标记(词片、音素)对齐。
  • 通过在真实语音和合成语音上的对比损失,以及在辅助解码头上的序列损失,联合优化语音编码器。
  • 仅对合成语音应用数据增强(20% 时间/频率掩码 + 频率扭曲),不应用于对比损失。
  • 该方法兼容多种 ASR 架构和训练目标,包括 CTC、RNN-T 和 HAT。
  • 通过使用领域内文本(如搜索查询)生成 TTS 数据用于预训练,实现领域自适应。
Fig. 1 : Proposed joint speech and text self-supervised pretraining architecture.
Fig. 1 : Proposed joint speech and text self-supervised pretraining architecture.

实验结果

研究问题

  • RQ1通过 TTS 生成的语音注入文本信息,能否改善自监督语音表征学习?
  • RQ2在低资源 ASR 设置下,未说话文本的数量如何影响性能提升?
  • RQ3将基于 TTS 的预训练与语言模型融合是否能带来进一步的 WER 改进?
  • RQ4辅助解码头目标函数的选择(如 CTC 与 RNN-T)如何影响学习效率?
  • RQ5tts4pretrain 是否能减少下游 ASR 微调对大规模转录数据的需求?

主要发现

  • 与仅使用真实语音进行预训练的 wav2vec2.0 相比,tts4pretrain 在 LibriSpeech 测试集上将 WER 相对降低 10%。
  • 在 AMI 会议转录任务中,该方法仅使用 100 小时转录数据,即可达到 5,000 小时转录数据的性能水平。
  • 使用 100 万个 TTS 生成的语音样本可使 WER 相对降低 6.8%,且在超过 1 亿个样本后收益递减。
  • 采用基于 CTC 的解码头时性能最佳,优于 RNN-T,因其具有更优的对齐特性。
  • 使用领域匹配文本(如搜索查询)生成 TTS 数据进行预训练,在内部语音搜索任务中实现 6.2% 的 WER,优于通用文本来源。
  • 当与 tts4pretrain 结合时,语言模型融合可带来额外 6% 相对 WER 降低,证实其互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。