Skip to main content
QUICK REVIEW

[论文解读] General-Purpose Speech Representation Learning through a Self-Supervised Multi-Granularity Framework

Yucheng Zhao, Dacheng Yin|arXiv (Cornell University)|Feb 3, 2021
Speech Recognition and Synthesis参考文献 29被引用 8
一句话总结

该论文提出MGF,一种用于通用语音表征学习的自监督多粒度框架,结合了细时间尺度(如音素)的生成学习与粗时间尺度(如句子)的判别学习。通过使用对比损失进行连续掩码语音建模,并在多个下游任务上进行训练,MGF实现了最先进性能,包括在LibriSpeech数据集上达到73.4%的音素准确率和100%的说话人分类准确率,优于先前的无监督方法。

ABSTRACT

This paper presents a self-supervised learning framework, named MGF, for general-purpose speech representation learning. In the design of MGF, speech hierarchy is taken into consideration. Specifically, we propose to use generative learning approaches to capture fine-grained information at small time scales and use discriminative learning approaches to distill coarse-grained or semantic information at large time scales. For phoneme-scale learning, we borrow idea from the masked language model but tailor it for the continuous speech signal by replacing classification loss with a contrastive loss. We corroborate our design by evaluating MGF representation on various downstream tasks, including phoneme classification, speaker classification, speech recognition, and emotion classification. Experiments verify that training at different time scales needs different training targets and loss functions, which in general complement each other and lead to a better performance.

研究动机与目标

  • 开发一种通用的语音表征学习框架,以捕捉跨多个时间尺度的分层语音结构。
  • 通过利用自监督学习,解决在无人工标注标签的情况下学习鲁棒且可迁移表征的挑战。
  • 证明在语音表征学习中,不同时间粒度下生成式与判别式学习目标各有最优表现。
  • 在包括音素分类、说话人识别、语音识别和情感分类在内的多样化下游任务上评估该框架。
  • 展示使用MGF进行预训练可显著提升低资源环境下的数据效率。

提出的方法

  • MGF采用深层双向Transformer架构,以在多个时间粒度上建模语音表征。
  • 针对细粒度(音素尺度)学习,MGF使用连续掩码语言模型(cMLM)并引入对比损失,而非分类任务,将BERT风格的掩码机制适配至连续语音信号。
  • 针对粗粒度(句子尺度)学习,MGF应用判别式对比学习,以捕捉语义和说话人级信息。
  • 该框架联合优化两种目标,实现声学与语义特征的互补学习。
  • 预训练在960小时的LibriSpeech数据上进行,表征通过在线性探测在下游任务上进行评估。
  • 根据任务需求对模型进行微调或冻结,消融实验确认了各组件的贡献。

实验结果

研究问题

  • RQ1统一的自监督框架能否有效学习跨多个时间粒度(如音素、词、句子)的语音表征?
  • RQ2结合生成式与判别式学习目标是否能提升多样化下游语音任务的性能?
  • RQ3与特定任务模型或先前的自监督模型(如wav2vec和x-vector)相比,MGF在泛化能力和数据效率方面表现如何?
  • RQ4在仅有少量标注数据的低资源设置下,使用MGF进行预训练能在多大程度上提升性能?
  • RQ5MGF表征能否在零样本或少样本适应任务(如一次样本说话人分类)中实现最先进性能?

主要发现

  • 在LibriSpeech数据集上,MGF在线性评估下实现了73.4%的音素分类准确率,超越了现有无监督预训练方法。
  • MGF在说话人分类任务上达到100%准确率,是首个在该基准上实现此结果的方法。
  • 在一次样本说话人分类任务中,MGF优于x-vector和d-vector等成熟方法,展现出强大的少样本泛化能力。
  • 在WSJ语音识别基准上,MGF-960的词错误率(WER)为4.87%,与特定任务的wav2vec-large模型相当,显著优于基线模型。
  • 在IEMOCAP情感分类任务上,MGF-Finetune实现了73.1%的准确率,成为纯音频方法中的新最先进水平。
  • 在仅6分钟标注数据的低资源设置下,MGF实现了72.3%的音素准确率,远超从零开始训练的模型(34.9%),展现出卓越的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。