Skip to main content
QUICK REVIEW

[论文解读] Generative Pre-Training for Speech with Autoregressive Predictive Coding

Yu-An Chung, James Glass|arXiv (Cornell University)|Oct 23, 2019
Speech Recognition and Synthesis参考文献 37被引用 10
一句话总结

本文提出自回归预测编码(APC)作为一种自监督生成预训练方法,用于从大规模无标签数据中学习可迁移的语音表征。通过训练编码器自回归地预测未来的频谱图帧,APC 学习到丰富且通用的表征,其在语音识别、语音翻译和说话人识别任务上的表现优于对数梅尔倒谱系数(log Mel spectrograms)及其他方法,同时显著降低了下游任务对数据量和模型参数量的需求。

ABSTRACT

Learning meaningful and general representations from unannotated speech that are applicable to a wide range of tasks remains challenging. In this paper we propose to use autoregressive predictive coding (APC), a recently proposed self-supervised objective, as a generative pre-training approach for learning meaningful, non-specific, and transferable speech representations. We pre-train APC on large-scale unlabeled data and conduct transfer learning experiments on three speech applications that require different information about speech characteristics to perform well: speech recognition, speech translation, and speaker identification. Extensive experiments show that APC not only outperforms surface features (e.g., log Mel spectrograms) and other popular representation learning methods on all three tasks, but is also effective at reducing downstream labeled data size and model parameters. We also investigate the use of Transformers for modeling APC and find it superior to RNNs.

研究动机与目标

  • 开发一种生成式预训练方法,从大规模无标签数据中学习通用、非特定且可迁移的语音表征。
  • 解决现有自监督方法去除与任务无关的可变性所带来的局限,这些方法可能丢弃对未知下游任务有用的有用信息。
  • 探究 APC 是否因保留原始信号信息,可作为多种语音应用中强大的预训练目标。
  • 评估 Transformer 与 RNN 作为 APC 主干架构在性能上的差异。
  • 研究 APC 表征在低资源设置下的数据效率与模型效率,特别是说话人识别中的少样本学习场景。

提出的方法

  • APC 使用自回归目标,即编码器基于截至 $ x_k $ 的历史帧预测未来帧 $ x_{k+n} $,通过最小化预测帧与目标帧之间的 L1 损失进行训练。
  • 编码器实现为单向 RNN(GRU)或带有正弦位置编码的 Transformer 解码器块,以建模序列依赖关系。
  • 在大规模无标签语音数据上使用自监督 APC 目标进行预训练,学习保留全局与局部语音结构的表征。
  • 在下游任务中,冻结预训练编码器,并通过任务特定头(如 ASR 的共形层,SID 的 GRU + Softmax)进行微调。
  • 该方法利用 APC 表征具有高度线性可分性的特点,使其可直接应用于多样化任务,而无需事先引入任务特定归纳偏置。
  • 实验在自动语音识别(ASR)、语音翻译和说话人识别任务上,使用标准基准对比 APC 与对数梅尔倒谱系数、CPC 和 PASE。

实验结果

研究问题

  • RQ1APC 是否能学习到在自动语音识别、语音翻译和说话人识别等多样化下游任务中均有效的通用语音表征?
  • RQ2在准确率与数据效率方面,APC 是否优于现有的自监督方法(如 CPC 和 PASE)?
  • RQ3在语音表征学习中,Transformer 架构是否比 RNN 更有效地建模 APC 目标?
  • RQ4APC 表征在多大程度上可减少下游任务对标注数据和模型参数的需求?
  • RQ5在少样本学习场景中,APC 表征的性能如何,特别是在每个说话人仅有一条或少数几条语音样本的说话人识别任务中?

主要发现

  • 基于 Transformer 的 APC(T-APC)在语音翻译任务上取得 14.3 的 BLEU 分数,优于 S-Transformer(13.8)和级联 ASR+MT 系统(14.6)。
  • 在说话人识别任务中,T-APC 在一次学习(one-shot learning,每说话人仅 1 条语音)场景下达到 17.6% 的准确率,几乎是 log Mel(8.7%)的两倍。
  • APC 表征显著减少了下游任务对标注数据和模型参数的需求,展现出卓越的数据效率与模型效率。
  • 在自动语音识别、语音翻译和说话人识别三项任务中,APC 均一致优于对数梅尔倒谱系数及其他自监督方法(CPC、PASE)。
  • 在低数据场景下,APC 与基线方法之间的性能差距进一步扩大,表明 APC 具有强大的泛化能力与数据效率。
  • 与其它方法相比,APC 表征具有更高的线性可分性,支持其在多样化任务中的可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。