Skip to main content
QUICK REVIEW

[论文解读] BYOL-S: Learning Self-supervised Speech Representations by Bootstrapping

Gasser Elbanna, Neil Scheidwasser|arXiv (Cornell University)|Jun 24, 2022
Speech and Audio Processing被引用 10
一句话总结

本文提出 BYOL-S,一种通过在 AudioSet 的语音子集上微调而优化的自监督语音表征模型,利用自举学习框架提升性能。该方法引入了一种结合手工特征(openSMILE)与学习特征的混合训练协议,并采用卷积 Transformer 编码器,在 HEAR 2021 挑战赛的多数音频任务中取得最先进结果,尤其在语音与环境声音分类任务中表现突出。

ABSTRACT

Methods for extracting audio and speech features have been studied since pioneering work on spectrum analysis decades ago. Recent efforts are guided by the ambition to develop general-purpose audio representations. For example, deep neural networks can extract optimal embeddings if they are trained on large audio datasets. This work extends existing methods based on self-supervised learning by bootstrapping, proposes various encoder architectures, and explores the effects of using different pre-training datasets. Lastly, we present a novel training framework to come up with a hybrid audio representation, which combines handcrafted and data-driven learned audio features. All the proposed representations were evaluated within the HEAR NeurIPS 2021 challenge for auditory scene classification and timestamp detection tasks. Our results indicate that the hybrid model with a convolutional transformer as the encoder yields superior performance in most HEAR challenge tasks.

研究动机与目标

  • 开发一种针对语音优化的通用音频表征模型,通过将 BYOL-A 框架适配至语音专用数据集实现。
  • 探究不同编码器架构、预训练数据集及训练窗口大小对自监督语音表征学习的影响。
  • 评估一种新型混合预训练协议,联合优化手工特征(openSMILE)与深度神经网络特征。
  • 通过超参数调优与窗口大小自适应,提升时间戳检测性能。
  • 在 HEAR 2021 挑战赛的 16 项下游任务中对所得表征进行基准测试。

提出的方法

  • 在 AudioSet 的语音专用子集上微调 BYOL-A 模型,构建 BYOL-S,一种面向语音优化的自监督表征学习器。
  • 探索多种编码器架构,包括卷积 Transformer(CvT),以提升表征质量。
  • 提出一种混合预训练协议,模型同时从 openSMILE 特征与深度网络嵌入中学习,采用共享损失函数。
  • 在时域与频域应用数据增强,以提升自监督预训练过程中的鲁棒性。
  • 对混合损失函数中的超参数 α 和 β 进行优化,发现当 α=β=1 时,语音与环境声音任务性能最佳。
  • 采用两阶段训练协议:首先在音频片段上预训练编码器,然后利用学习到的表征在下游任务上进行微调。

实验结果

研究问题

  • RQ1与原始模型相比,在语音专用数据集上微调 BYOL-A 是否能提升其在语音相关下游任务上的性能?
  • RQ2不同编码器架构(如卷积 Transformer)如何影响自监督语音表征的质量?
  • RQ3结合手工特征(openSMILE)与深度学习特征的混合预训练协议能否提升通用音频表征学习性能?
  • RQ4在混合损失函数中,由超参数 α 和 β 控制的手工特征与学习特征之间的最优平衡是什么?
  • RQ5预训练期间的窗口大小如何影响时间戳检测任务的性能,特别是对瞬态音乐事件?

主要发现

  • 采用卷积 Transformer 编码器的混合模型(BYOL-S/CvT)在 HEAR 2021 基准的大多数任务中表现优异,优于原始 BYOL-S 与基线模型。
  • 在语音与环境声音任务中,最优超参数设置为 α=β=1,当比例失衡时性能显著下降。
  • 在音乐相关任务中,α=β=1 的结果明显劣于其他比例,表明最优超参数选择具有数据集依赖性。
  • 混合训练协议优于简单拼接 openSMILE 与 BYOL-S 嵌入的方法,表明联合优化可缓解维度灾难并提升特征相关性。
  • 显著减小预训练窗口大小可大幅提升 MAESTRO 音乐转录任务中的音符起始点检测性能,凸显时间分辨率对瞬态事件的重要性。
  • 混合 BYOL-S/CvT 模型在语音中的认知与生理负荷检测任务中也取得具有竞争力的结果,验证了其在 HEAR 基准之外的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。